Životný cyklus základných modelov

Pretraining

Predtrénovanie modelu

Pretraining je prvá rozsiahla fáza učenia modelu na všeobecnom alebo široko pokrývajúcom korpuse pred adaptáciou na konkrétnu úlohu. Model sa učí reprezentácie pomocou self-supervised, supervised alebo multimodálnych cieľov, napríklad predikcie ďalšieho tokenu, maskovanej jednotky alebo zhody obrazu s textom. Výsledkom je základ, ktorý možno používať priamo, dolaďovať, inštruovať alebo prepájať s retrievalom. Kvalitu určujú dáta, deduplikácia, kurikulum, architektúra a výpočtový rozpočet. Predtrénovanie môže zároveň absorbovať bias, citlivé údaje a nežiaduce korelácie.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-P-14

Odborná definícia

Odborná definícia

Pretraining je prvá rozsiahla fáza učenia modelu na všeobecnom alebo široko pokrývajúcom korpuse pred adaptáciou na konkrétnu úlohu. Model sa učí reprezentácie pomocou self-supervised, supervised alebo multimodálnych cieľov, napríklad predikcie ďalšieho tokenu, maskovanej jednotky alebo zhody obrazu s textom. Výsledkom je základ, ktorý možno používať priamo, dolaďovať, inštruovať alebo prepájať s retrievalom. Kvalitu určujú dáta, deduplikácia, kurikulum, architektúra a výpočtový rozpočet. Predtrénovanie môže zároveň absorbovať bias, citlivé údaje a nežiaduce korelácie.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Namiesto učenia modelu iba na niekoľkých tisícoch firemných otázok sa najprv vytvorí široký jazykový základ na veľkom korpuse. Model sa naučí syntax, významové vzťahy a množstvo vzorov, potom sa prispôsobí podpore zákazníkov. Firemné dáta však nemajú automaticky opraviť všetko, čo si základ osvojil, a môžu byť príliš malé na zmenu hlbokých reprezentácií. Pri výbere predtrénovaného modelu sa preto skúma pôvod dát, licencia, podporované jazyky, context window, známe riziká a reálny výkon na doméne.

Časté otázky

Časté otázky

Ako sa pretraining líši od fine-tuningu?

Pretraining vytvára všeobecné reprezentácie na širokých dátach a býva výpočtovo najdrahší. Fine-tuning prispôsobuje hotový základ menšiemu datasetu, úlohe alebo požadovanému správaniu.

Čo znamená self-supervised pretraining?

Cieľ sa vytvorí zo samotných dát bez ručného labelovania, napríklad skrytím tokenu alebo predikciou ďalšej časti sekvencie. Dáta však stále potrebujú výber, čistenie a governance.

Dá sa pretraining pokračovať na doménovom korpuse?

Áno, continual alebo domain-adaptive pretraining ďalej optimalizuje pôvodný cieľ na odborných textoch. Môže zlepšiť terminológiu, ale tiež spôsobiť forgetting alebo zosilniť úzky bias.

Prečo je deduplikácia dôležitá?

Opakované dokumenty menia efektívne váhy zdrojov, podporujú memorovanie a kontaminujú benchmarky. Deduplikácia musí riešiť presné aj približné kópie na úrovni dokumentov a fragmentov.

Ako sa audituje predtrénovaný model bez prístupu k dátam?

Používajú sa model cards, dokumentácia poskytovateľa, licenčná analýza, behaviorálne testy, skúšky memorovania a doménové benchmarky. Nepriehľadnosť zostáva samostatným rizikom.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Google, Introduction to Large Language Models BERT, Pre-training of Deep Bidirectional Transformers

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.