Škálování nelineárnych modelů

Aproximace jádrové funkce

Kernel approximation je technika, která nahradí implicitní práci s plnou n krát n kernelovou maticou konečnou explicitní reprezentací příznaků s nižší dimenzí. Metody jako Nyström nebo random Fourier features približují zvolený kernel tak, aby se následně dal použít rychlý lineární model. Výpočetní a paměťová úspora závisí na počtu komponentů, spektra dat a kernelu, přičemž hrubá aproximace může snížit přesnost i kalibraci. Transformace se musí fitovat pouze na tréninkových datech, aby nevznikl validační únik.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-K-10

Odborná definice

Odborná definice

Kernel approximation je technika, která nahradí implicitní práci s plnou n krát n kernelovou maticou konečnou explicitní reprezentací příznaků s nižší dimenzí. Metody jako Nyström nebo random Fourier features približují zvolený kernel tak, aby se následně dal použít rychlý lineární model. Výpočetní a paměťová úspora závisí na počtu komponentů, spektra dat a kernelu, přičemž hrubá aproximace může snížit přesnost i kalibraci. Transformace se musí fitovat pouze na tréninkových datech, aby nevznikl validační únik.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

RBF SVM na milióne záznamů by musel pracovat s obrovským množstvím párových podobností. Aproximace vytvoří pro každý záznam kratší nový vektor, ve kterém obyčejný lineární součin přibližně napodobňuje RBF kernel. Trénink potom využije lineární algoritmus a zmestí se do dostupnej paměti. Počet komponentů je regulačný kohútik. Málo komponentů je rýchlych, ale rozmaže jemné vzory, mnoho komponentů se blíži původnému kernelu, ale vrací část nákladů. Praktické ladění proto hledá bod, kde další paměť už neprináša meratelný prírastok kvality.

Časté otázky

Časté otázky

Jako funguje Nyströmova metoda?

Vybere podmnožinu referenčních bodů, vypočítá kernel mezi daty a touto podmnožinou a z nízkorozmerného rozkladu zostrojí explicitní příznaky. Kvalita závisí na počtu a reprezentativnosti vybraných bodů.

Co robia random Fourier features?

Pro posunovo invariantné kernely vzorkují náhodné frekvence z príslušného spektra a mapují vstupy přes sínusové a kosínusové funkce. Skalárny součin těchto příznaků Monte Carlo způsobem přibližuje kernel.

Jako zvolit počet komponentů?

Měří se validační výkon, čas tréninku, latence a paměť při rastúcom počtu komponentů. Bod, kde další komponenty prinášají malý zisk, je praktický kompromis, ne univerzální konštanta.

Je aproximace vhodná i pro online učení?

Ano. Po explicitnej transformaci lze použít lineární modely s partial_fit nebo mini-batch optimalizací. Samotná mapovace funkce a její náhodný seed však musí zůstat konzistentní během celého životního cyklu.

Jak se ověřuje chyba aproximace?

Lze porovnat přibližné a přesné kernelové hodnoty na vzorku, sledovat spektrálnu chybu nebo přímo měřit rozdíl výkonu downstream modelu. Důležitá je i stabilita mezi náhodnými seedmi.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • scikit-learn, Kernel Approximation
  • scikit-learn, Nystroem

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.