Odborná definícia
Odborná definícia
Unsupervised pretraining je úvodná fáza učenia, v ktorej model získava všeobecné reprezentácie z veľkého množstva neoznačených dát pred dolaďovaním na konkrétnu úlohu. Historicky sa používali autoencodery a restricted Boltzmann machines, pri jazyku predikcia tokenov a pri obraze rekonštrukčné alebo kontrastívne ciele. Pojem sa dnes často prekrýva so self-supervised pretrainingom. Prínos závisí od zhody korpusu s cieľovou doménou, kvality pomocného cieľa a rizika prenesenia biasov, memorovania či nežiaducich schopností. Predtréningové a cieľové dáta sa kontrolujú na kontamináciu testu, aby sa prenos nezamenil za zapamätanie benchmarku.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Model sa najprv učí všeobecné zákonitosti bez toho, aby poznal konečnú úlohu. Jazykový model predpovedá chýbajúce alebo ďalšie tokeny, obrazový model skladá zakrytý obsah alebo porovnáva dve verzie snímky. Keď neskôr dostane malú označenú množinu, nezačína od náhodných váh. Už pozná štruktúru jazyka alebo obrazu a dolaďuje iba smer potrebný pre klasifikáciu či generovanie. Ak bol však predtréningový korpus veľmi odlišný, prenos môže byť slabý alebo zavádzajúci. Pri hodnotení sa uvádza aj cena predtréningu, pretože menší model trénovaný od nuly môže byť pre úzku úlohu efektívnejší.
Časté otázky
Časté otázky
Ako sa unsupervised pretraining líši od self-supervised pretrainingu?
Self-supervised prístup vytvára explicitný cieľ zo samotných dát. V modernej literatúre často nahradil širšie označenie unsupervised, hoci oba nepoužívajú ručné štítky.
Prečo predtrénovanie znižuje potrebu označených dát?
Model už má reprezentácie základných vzorov. Dolaďovanie sa učí mapovanie na cieľovú úlohu namiesto budovania všetkých príznakov od začiatku.
Môže predtrénovanie zhoršiť výsledok?
Áno. Negatívny transfer vzniká pri rozdielnej doméne, nevhodnom cieli alebo prenose biasov. Baseline s náhodnou inicializáciou zostáva dôležitým porovnaním.
Čo sa počas fine-tuningu zmrazuje?
Možno zmraziť celý encoder, iba skoré vrstvy alebo nič. Rozhodnutie závisí od veľkosti označených dát, podobnosti domény a rizika catastrophic forgetting.
Ako sa dokumentuje predtrénovaný model?
Uvádza sa pôvod korpusu, časový rozsah, jazyky, licencie, pomocný cieľ, architektúra, vylúčenia, známe riziká a evaluačné výsledky pred aj po prenose.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- A Fast Learning Algorithm for Deep Belief Nets BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
