Odborná definice
Odborná definice
Pretraining je první rozsiahla fáza učení modelu na všeobecnom nebo široko pokrývajúcom korpuse před adaptací na konkrétní úlohu. Model se učí reprezentace pomocí self-supervised, supervised nebo multimodálnych cílů, například predikce dalšího tokenu, maskovanej jednotky nebo shody obrazu s textem. Výsledkem je základ, který lze používat přímo, dolaďovat, inštruovat nebo prepájat s retrievalem. Kvalitu určují data, deduplikace, kurikulum, architektura a výpočetní rozpočet. Předtrénování může zároveň absorbovat bias, citlivé údaje a nežádoucí korelace.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Místo učení modelu pouze na několika tisícoch firemných otázek se nejprve vytvoří široký jazykový základ na velkém korpuse. Model se naučí syntax, významové vztahy a množství vzorů, potom se prispůsobí podpoře zákazníků. Firemné data však nemají automaticky opravit vše, co si základ osvojil, a mohou být příliš malé na změnu hlubokých reprezentací. Při výběru předtrénovaného modelu se proto zkoumá původ dat, licence, podporované jazyky, context window, známé rizika a reálný výkon na doméně.
Časté otázky
Časté otázky
Jak se pretraining liší od fine-tuningu?
Pretraining vytváří obecné reprezentace na širokých datech a bývá výpočetně najdrahší. Fine-tuning přizpůsobuje hotový základ menšiemu datasetu, úloze nebo požadovanému chování.
Co znamená self-supervised pretraining?
Cíl se vytvoří ze samotných dat bez ručného labelování, například skrytím tokenu nebo predikcí další části sekvence. Data však stále potřebují výběr, čištění a governance.
Lze pretraining pokračovat na doménovém korpuse?
Ano, continual nebo domain-adaptive pretraining dále optimalizuje původní cíl na odborných textoch. Může zlepšit terminologii, ale také způsobit forgetting nebo zosilnit úzký bias.
Proč je deduplikace důležitá?
Opakované dokumenty mění efektivně váhy zdrojů, podporují memorování a kontaminují benchmarky. Deduplikace musí řešit přesné i přibližné kopie na úrovni dokumentů a fragmentů.
Jak se audituje předtrénovaný model bez přístupu k datům?
Používají se model cards, dokumentace poskytovatela, licenčná analýza, behaviorálne testy, skúšky memorování a doménové benchmarky. Nepriehladnost zůstává samostatným rizikem.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Google, Introduction to Large Language Models BERT, Pre-training of Deep Bidirectional Transformers
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
