Odborná definice
Odborná definice
Hyperparameter optimization je systematické hladání hodnot nastavení, které se model nenaučí přímo gradientem z tréninkových dat, například learning rate, regularizace, hloubka stromu, počet vrstev nebo parametry augmentace. Každý kandidát se natrénuje nebo částečně vyhodnotí a porovná na validačním cílí. Používá se grid search, random search, bayesovská optimalizace, evolučné metody a multi-fidelity postupy s predčasným ukončením. Výsledek je podmíněný zvoleným prostorem, rozpočtom, metrikou a náhodou. Opakované ladění na té určité validaci může preučit celý vývojový proces.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Trénink modelu je jako pečení podle receptu, při kterém se váhy modelu učí během pečení, ale teplotu rúry, čas, velikost formy a poměr ingrediencií zvolíte předem. Optimalizace hyperparametrů zkouší kombinace těchto nastavení a měří výsledek na oddělené validační sade. Náhodné skúšání může být účinnejšie než pravidelná mriežka, pokud na výkone záleží pouze několik rozměrů. Při drahých modelech se slabé běhy zastavia dříve a rozpočet se přesune k slubným kandidátom. Pokud však stále pozeráte na finálny test, optimalizujete i jeho náhodné zvláštnosti.
Časté otázky
Časté otázky
Jaký je rozdíl mezi parametrem a hyperparametrom?
Parameter, například váha neuronu, se odhaduje během tréninku z dat. Hyperparameter řídí trénink, architekturu nebo předzpracování a jeho hodnota se volí mimo vnútorného optimalizačného kroku, ačkoli hranice může být v meta-učení flexibilná.
Proč random search často prekoná grid search?
Pokud je důležitých pouze několik hyperparametrů, mriežka míňa mnoho běhů na opakování stejných hodnot v těchto rozmeroch. Náhodné vzorkování preskúma více unikátnych hodnot každého relevantného parametru.
Co je bayesovská optimalizace?
Vytváří náhradný model vztahu mezi nastavením a výsledkem a akvizičnou funkcí vybírá další kandidát. Vyvažuje skúšání slubných oblastí a prieskum neistých částí prostoru při obmedzenom počtu běhů.
Jako funguje multi-fidelity optimalizace?
Kandidáti se nejprve hodnotí lacnejšie, například na menším datasete, kratšom tréninku nebo nižšom rozlišení. Slubné konfigurace dostanou více zdrojů. Lacný signál však musí dostatečně korelovat s plným tréninkem.
Jak se zabrání přeučení validační sady?
Omezí se počet adaptívnych pokusů, použije vnorená křížová validace nebo samostatný finálny test. Uchovává se historie experimentů a reportuje se nejistota, ne pouze nejlepší výsledek ze stoviek běhů.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Bergstra a Bengio, Random Search for Hyper-Parameter Optimization (jmlr.org) Snoek, Larochelle a Adams, Practical Bayesian Optimization (arxiv.org)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
