Odborná definice
Význam a odborné vymezení pojmu
Pretraining je první rozsiahla fáza učení modelu na všeobecnom nebo široko pokrývajúcom korpuse před adaptací na konkrétní úlohu. Model se učí reprezentace pomocí self-supervised, supervised nebo multimodálnych cílů, například predikce dalšího tokenu, maskovanej jednotky nebo shody obrazu s textem. Výsledkem je základ, který lze používat přímo, dolaďovat, inštruovat nebo prepájat s retrievalem. Kvalitu určují data, deduplikace, kurikulum, architektura a výpočetní rozpočet. Předtrénování může zároveň absorbovat bias, citlivé údaje a nežádoucí korelace.
Srozumitelné vysvětlení
Jak se pojem používá v praxi
Místo učení modelu pouze na několika tisícoch firemných otázek se nejprve vytvoří široký jazykový základ na velkém korpuse. Model se naučí syntax, významové vztahy a množství vzorů, potom se prispůsobí podpoře zákazníků. Firemné data však nemají automaticky opravit vše, co si základ osvojil, a mohou být příliš malé na změnu hlubokých reprezentací. Při výběru předtrénovaného modelu se proto zkoumá původ dat, licence, podporované jazyky, context window, známé rizika a reálný výkon na doméně.
Časté otázky
Otázky, které upřesňují význam
Jak se pretraining liší od fine-tuningu?
Pretraining vytváří obecné reprezentace na širokých datech a bývá výpočetně najdrahší. Fine-tuning přizpůsobuje hotový základ menšiemu datasetu, úloze nebo požadovanému chování.
Co znamená self-supervised pretraining?
Cíl se vytvoří ze samotných dat bez ručného labelování, například skrytím tokenu nebo predikcí další části sekvence. Data však stále potřebují výběr, čištění a governance.
Lze pretraining pokračovat na doménovém korpuse?
Ano, continual nebo domain-adaptive pretraining dále optimalizuje původní cíl na odborných textoch. Může zlepšit terminologii, ale také způsobit forgetting nebo zosilnit úzký bias.
Proč je deduplikace důležitá?
Opakované dokumenty mění efektivně váhy zdrojů, podporují memorování a kontaminují benchmarky. Deduplikace musí řešit přesné i přibližné kopie na úrovni dokumentů a fragmentů.
Jak se audituje předtrénovaný model bez přístupu k datům?
Používají se model cards, dokumentace poskytovatela, licenčná analýza, behaviorálne testy, skúšky memorování a doménové benchmarky. Nepriehladnost zůstává samostatným rizikem.
Související pojmy
Významové a tematické souvislosti
Zdroje a redakční stopa
Použitá východiska a odborná revize
- Google, Introduction to Large Language Models BERT, Pre-training of Deep Bidirectional Transformers
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
