Odborná definice
Význam a odborné vymezení pojmu
Hyperparameter optimization je systematické hladání hodnot nastavení, které se model nenaučí přímo gradientem z tréninkových dat, například learning rate, regularizace, hloubka stromu, počet vrstev nebo parametry augmentace. Každý kandidát se natrénuje nebo částečně vyhodnotí a porovná na validačním cílí. Používá se grid search, random search, bayesovská optimalizace, evolučné metody a multi-fidelity postupy s predčasným ukončením. Výsledek je podmíněný zvoleným prostorem, rozpočtom, metrikou a náhodou. Opakované ladění na té určité validaci může preučit celý vývojový proces.
Srozumitelné vysvětlení
Jak se pojem používá v praxi
Trénink modelu je jako pečení podle receptu, při kterém se váhy modelu učí během pečení, ale teplotu rúry, čas, velikost formy a poměr ingrediencií zvolíte předem. Optimalizace hyperparametrů zkouší kombinace těchto nastavení a měří výsledek na oddělené validační sade. Náhodné skúšání může být účinnejšie než pravidelná mriežka, pokud na výkone záleží pouze několik rozměrů. Při drahých modelech se slabé běhy zastavia dříve a rozpočet se přesune k slubným kandidátom. Pokud však stále pozeráte na finálny test, optimalizujete i jeho náhodné zvláštnosti.
Časté otázky
Otázky, které upřesňují význam
Jaký je rozdíl mezi parametrem a hyperparametrom?
Parameter, například váha neuronu, se odhaduje během tréninku z dat. Hyperparameter řídí trénink, architekturu nebo předzpracování a jeho hodnota se volí mimo vnútorného optimalizačného kroku, ačkoli hranice může být v meta-učení flexibilná.
Proč random search často prekoná grid search?
Pokud je důležitých pouze několik hyperparametrů, mriežka míňa mnoho běhů na opakování stejných hodnot v těchto rozmeroch. Náhodné vzorkování preskúma více unikátnych hodnot každého relevantného parametru.
Co je bayesovská optimalizace?
Vytváří náhradný model vztahu mezi nastavením a výsledkem a akvizičnou funkcí vybírá další kandidát. Vyvažuje skúšání slubných oblastí a prieskum neistých částí prostoru při obmedzenom počtu běhů.
Jako funguje multi-fidelity optimalizace?
Kandidáti se nejprve hodnotí lacnejšie, například na menším datasete, kratšom tréninku nebo nižšom rozlišení. Slubné konfigurace dostanou více zdrojů. Lacný signál však musí dostatečně korelovat s plným tréninkem.
Jak se zabrání přeučení validační sady?
Omezí se počet adaptívnych pokusů, použije vnorená křížová validace nebo samostatný finálny test. Uchovává se historie experimentů a reportuje se nejistota, ne pouze nejlepší výsledek ze stoviek běhů.
Související pojmy
Významové a tematické souvislosti
Zdroje a redakční stopa
Použitá východiska a odborná revize
- Bergstra a Bengio, Random Search for Hyper-Parameter Optimization (jmlr.org) Snoek, Larochelle a Adams, Practical Bayesian Optimization (arxiv.org)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
