Odborná definícia
Odborná definícia
Pretraining je prvá rozsiahla fáza učenia modelu na všeobecnom alebo široko pokrývajúcom korpuse pred adaptáciou na konkrétnu úlohu. Model sa učí reprezentácie pomocou self-supervised, supervised alebo multimodálnych cieľov, napríklad predikcie ďalšieho tokenu, maskovanej jednotky alebo zhody obrazu s textom. Výsledkom je základ, ktorý možno používať priamo, dolaďovať, inštruovať alebo prepájať s retrievalom. Kvalitu určujú dáta, deduplikácia, kurikulum, architektúra a výpočtový rozpočet. Predtrénovanie môže zároveň absorbovať bias, citlivé údaje a nežiaduce korelácie.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Namiesto učenia modelu iba na niekoľkých tisícoch firemných otázok sa najprv vytvorí široký jazykový základ na veľkom korpuse. Model sa naučí syntax, významové vzťahy a množstvo vzorov, potom sa prispôsobí podpore zákazníkov. Firemné dáta však nemajú automaticky opraviť všetko, čo si základ osvojil, a môžu byť príliš malé na zmenu hlbokých reprezentácií. Pri výbere predtrénovaného modelu sa preto skúma pôvod dát, licencia, podporované jazyky, context window, známe riziká a reálny výkon na doméne.
Časté otázky
Časté otázky
Ako sa pretraining líši od fine-tuningu?
Pretraining vytvára všeobecné reprezentácie na širokých dátach a býva výpočtovo najdrahší. Fine-tuning prispôsobuje hotový základ menšiemu datasetu, úlohe alebo požadovanému správaniu.
Čo znamená self-supervised pretraining?
Cieľ sa vytvorí zo samotných dát bez ručného labelovania, napríklad skrytím tokenu alebo predikciou ďalšej časti sekvencie. Dáta však stále potrebujú výber, čistenie a governance.
Dá sa pretraining pokračovať na doménovom korpuse?
Áno, continual alebo domain-adaptive pretraining ďalej optimalizuje pôvodný cieľ na odborných textoch. Môže zlepšiť terminológiu, ale tiež spôsobiť forgetting alebo zosilniť úzky bias.
Prečo je deduplikácia dôležitá?
Opakované dokumenty menia efektívne váhy zdrojov, podporujú memorovanie a kontaminujú benchmarky. Deduplikácia musí riešiť presné aj približné kópie na úrovni dokumentov a fragmentov.
Ako sa audituje predtrénovaný model bez prístupu k dátam?
Používajú sa model cards, dokumentácia poskytovateľa, licenčná analýza, behaviorálne testy, skúšky memorovania a doménové benchmarky. Nepriehľadnosť zostáva samostatným rizikom.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Google, Introduction to Large Language Models BERT, Pre-training of Deep Bidirectional Transformers
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
