Odborná definícia
Význam a odborné vymedzenie pojmu
Hyperparameter optimization je systematické hľadanie hodnôt nastavení, ktoré sa model nenaučí priamo gradientom z tréningových dát, napríklad learning rate, regularizácia, hĺbka stromu, počet vrstiev alebo parametre augmentácie. Každý kandidát sa natrénuje alebo čiastočne vyhodnotí a porovná na validačnom cieli. Používa sa grid search, random search, bayesovská optimalizácia, evolučné metódy a multi-fidelity postupy s predčasným ukončením. Výsledok je podmienený zvoleným priestorom, rozpočtom, metrikou a náhodou. Opakované ladenie na tej istej validácii môže preučiť celý vývojový proces.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Tréning modelu je ako pečenie podľa receptu, pri ktorom sa váhy modelu učia počas pečenia, ale teplotu rúry, čas, veľkosť formy a pomer ingrediencií zvolíte vopred. Optimalizácia hyperparametrov skúša kombinácie týchto nastavení a meria výsledok na oddelenej validačnej sade. Náhodné skúšanie môže byť účinnejšie než pravidelná mriežka, ak na výkone záleží iba niekoľko rozmerov. Pri drahých modeloch sa slabé behy zastavia skôr a rozpočet sa presunie k sľubným kandidátom. Ak však stále pozeráte na finálny test, optimalizujete aj jeho náhodné zvláštnosti.
Časté otázky
Otázky, ktoré spresňujú význam
Aký je rozdiel medzi parametrom a hyperparametrom?
Parameter, napríklad váha neurónu, sa odhaduje počas tréningu z dát. Hyperparameter riadi tréning, architektúru alebo predspracovanie a jeho hodnota sa volí mimo vnútorného optimalizačného kroku, hoci hranica môže byť v meta-učení flexibilná.
Prečo random search často prekoná grid search?
Ak je dôležitých iba niekoľko hyperparametrov, mriežka míňa mnoho behov na opakovanie rovnakých hodnôt v týchto rozmeroch. Náhodné vzorkovanie preskúma viac unikátnych hodnôt každého relevantného parametra.
Čo je bayesovská optimalizácia?
Vytvára náhradný model vzťahu medzi nastavením a výsledkom a akvizičnou funkciou vyberá ďalší kandidát. Vyvažuje skúšanie sľubných oblastí a prieskum neistých častí priestoru pri obmedzenom počte behov.
Ako funguje multi-fidelity optimalizácia?
Kandidáti sa najprv hodnotia lacnejšie, napríklad na menšom datasete, kratšom tréningu alebo nižšom rozlíšení. Sľubné konfigurácie dostanú viac zdrojov. Lacný signál však musí dostatočne korelovať s plným tréningom.
Ako sa zabráni preučeniu validačnej sady?
Obmedzí sa počet adaptívnych pokusov, použije vnorená krížová validácia alebo samostatný finálny test. Uchováva sa história experimentov a reportuje sa neistota, nie iba najlepší výsledok zo stoviek behov.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Bergstra a Bengio, Random Search for Hyper-Parameter Optimization (jmlr.org) Snoek, Larochelle a Adams, Practical Bayesian Optimization (arxiv.org)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
