Škálovanie nelineárnych modelov

Kernel approximation

Aproximácia jadrovej funkcie

Kernel approximation je technika, ktorá nahradí implicitnú prácu s plnou n krát n kernelovou maticou konečnou explicitnou reprezentáciou príznakov s nižšou dimenziou. Metódy ako Nyström alebo random Fourier features približujú zvolený kernel tak, aby sa následne dal použiť rýchly lineárny model. Výpočtová a pamäťová úspora závisí od počtu komponentov, spektra dát a kernelu, pričom hrubá aproximácia môže znížiť presnosť aj kalibráciu. Transformácia sa musí fitovať iba na tréningových dátach, aby nevznikol validačný únik.

Posledná odborná revízia
30. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-K-10

Odborná definícia

Odborná definícia

Kernel approximation je technika, ktorá nahradí implicitnú prácu s plnou n krát n kernelovou maticou konečnou explicitnou reprezentáciou príznakov s nižšou dimenziou. Metódy ako Nyström alebo random Fourier features približujú zvolený kernel tak, aby sa následne dal použiť rýchly lineárny model. Výpočtová a pamäťová úspora závisí od počtu komponentov, spektra dát a kernelu, pričom hrubá aproximácia môže znížiť presnosť aj kalibráciu. Transformácia sa musí fitovať iba na tréningových dátach, aby nevznikol validačný únik.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

RBF SVM na milióne záznamov by musel pracovať s obrovským množstvom párových podobností. Aproximácia vytvorí pre každý záznam kratší nový vektor, v ktorom obyčajný lineárny súčin približne napodobňuje RBF kernel. Tréning potom využije lineárny algoritmus a zmestí sa do dostupnej pamäte. Počet komponentov je regulačný kohútik. Málo komponentov je rýchlych, ale rozmaže jemné vzory, veľa komponentov sa blíži pôvodnému kernelu, no vracia časť nákladov. Praktické ladenie preto hľadá bod, kde ďalšia pamäť už neprináša merateľný prírastok kvality.

Časté otázky

Časté otázky

Ako funguje Nyströmova metóda?

Vyberie podmnožinu referenčných bodov, vypočíta kernel medzi dátami a touto podmnožinou a z nízkorozmerného rozkladu zostrojí explicitné príznaky. Kvalita závisí od počtu a reprezentatívnosti vybraných bodov.

Čo robia random Fourier features?

Pre posunovo invariantné kernely vzorkujú náhodné frekvencie z príslušného spektra a mapujú vstupy cez sínusové a kosínusové funkcie. Skalárny súčin týchto príznakov Monte Carlo spôsobom približuje kernel.

Ako zvoliť počet komponentov?

Meria sa validačný výkon, čas tréningu, latencia a pamäť pri rastúcom počte komponentov. Bod, kde ďalšie komponenty prinášajú malý zisk, je praktický kompromis, nie univerzálna konštanta.

Je aproximácia vhodná aj pre online učenie?

Áno. Po explicitnej transformácii možno použiť lineárne modely s partial_fit alebo mini-batch optimalizáciou. Samotná mapovacia funkcia a jej náhodný seed však musia zostať konzistentné počas celého životného cyklu.

Ako sa overuje chyba aproximácie?

Možno porovnať približné a presné kernelové hodnoty na vzorke, sledovať spektrálnu chybu alebo priamo merať rozdiel výkonu downstream modelu. Dôležitá je aj stabilita medzi náhodnými seedmi.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • scikit-learn, Kernel Approximation
  • scikit-learn, Nystroem

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.