Odborná definice
Odborná definice
Unsupervised pretraining je úvodná fáza učení, ve které model získává obecné reprezentace z velkého množství neoznačených dat před dolaďováním na konkrétní úlohu. Historicky se používali autoencodery a restricted Boltzmann machines, při jazyku predikce tokenů a při obraze rekonštrukčné nebo kontrastivně cíle. Pojem se dnes často prekrýva se self-supervised pretrainingom. Přínos závisí na shody korpusu s cílovou doménou, kvality pomocného cíle a rizika prenesení biasů, memorování či nežiaducich schopností. Predtréningové a cílové data se kontrolují na kontaminaci testu, aby se přenos nezamenil za zapametání benchmarku.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Model se nejprve učí obecné zákonitosti bez toho, aby poznal konečnou úlohu. Jazykový model predpovedá chybějící nebo další tokeny, obrazový model skládá zakrytý obsah nebo porovnává dvě verze snímky. Když později dostane malou označenou množinu, nezačína od náhodných váh. Už pozná strukturu jazyka nebo obrazu a dolaďuje pouze směr potřebný pro klasifikaci či generování. Pokud byl však predtréningový korpus velmi odlišný, přenos může být slabý nebo zavádzajúci. Při hodnocení se uvádí i cena predtréningu, protože menší model trénovaný od nuly může být pro úzku úlohu efektívnejší.
Časté otázky
Časté otázky
Jak se unsupervised pretraining liší od self-supervised pretrainingu?
Self-supervised přístup vytváří explicitní cíl ze samotných dat. V modernej literatúre často nahradil šířeji označení unsupervised, ačkoli oba nepoužívají ruční štítky.
Proč předtrénování snižuje potřebu označených dat?
Model už má reprezentace základných vzorů. Dolaďování se učí mapování na cílovou úlohu místo budování všech příznaků od začátku.
Může předtrénování zhoršit výsledek?
Ano. Negativní transfer vzniká při rozdílné doméně, nevhodném cílí nebo prenose biasů. Baseline s náhodnou inicializací zůstává důležitým porovnáním.
Co se během fine-tuningu zmrazuje?
Lze zmrazit celý encoder, pouze časné vrstvy nebo nic. Rozhodnutí závisí na velikosti označených dat, podobnosti domény a rizika catastrophic forgetting.
Jak se dokumentuje předtrénovaný model?
Uvádí se původ korpusu, časový rozsah, jazyky, licence, pomocný cíl, architektura, vylúčení, známé rizika a evaluačné výsledky před i po prenose.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- A Fast Learning Algorithm for Deep Belief Nets BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
