Životní cyklus základných modelů

Předtrénování modelu

Pretraining je první rozsiahla fáza učení modelu na všeobecnom nebo široko pokrývajúcom korpuse před adaptací na konkrétní úlohu. Model se učí reprezentace pomocí self-supervised, supervised nebo multimodálnych cílů, například predikce dalšího tokenu, maskovanej jednotky nebo shody obrazu s textem. Výsledkem je základ, který lze používat přímo, dolaďovat, inštruovat nebo prepájat s retrievalem. Kvalitu určují data, deduplikace, kurikulum, architektura a výpočetní rozpočet. Předtrénování může zároveň absorbovat bias, citlivé údaje a nežádoucí korelace.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-P-14

Odborná definice

Odborná definice

Pretraining je první rozsiahla fáza učení modelu na všeobecnom nebo široko pokrývajúcom korpuse před adaptací na konkrétní úlohu. Model se učí reprezentace pomocí self-supervised, supervised nebo multimodálnych cílů, například predikce dalšího tokenu, maskovanej jednotky nebo shody obrazu s textem. Výsledkem je základ, který lze používat přímo, dolaďovat, inštruovat nebo prepájat s retrievalem. Kvalitu určují data, deduplikace, kurikulum, architektura a výpočetní rozpočet. Předtrénování může zároveň absorbovat bias, citlivé údaje a nežádoucí korelace.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Místo učení modelu pouze na několika tisícoch firemných otázek se nejprve vytvoří široký jazykový základ na velkém korpuse. Model se naučí syntax, významové vztahy a množství vzorů, potom se prispůsobí podpoře zákazníků. Firemné data však nemají automaticky opravit vše, co si základ osvojil, a mohou být příliš malé na změnu hlubokých reprezentací. Při výběru předtrénovaného modelu se proto zkoumá původ dat, licence, podporované jazyky, context window, známé rizika a reálný výkon na doméně.

Časté otázky

Časté otázky

Jak se pretraining liší od fine-tuningu?

Pretraining vytváří obecné reprezentace na širokých datech a bývá výpočetně najdrahší. Fine-tuning přizpůsobuje hotový základ menšiemu datasetu, úloze nebo požadovanému chování.

Co znamená self-supervised pretraining?

Cíl se vytvoří ze samotných dat bez ručného labelování, například skrytím tokenu nebo predikcí další části sekvence. Data však stále potřebují výběr, čištění a governance.

Lze pretraining pokračovat na doménovém korpuse?

Ano, continual nebo domain-adaptive pretraining dále optimalizuje původní cíl na odborných textoch. Může zlepšit terminologii, ale také způsobit forgetting nebo zosilnit úzký bias.

Proč je deduplikace důležitá?

Opakované dokumenty mění efektivně váhy zdrojů, podporují memorování a kontaminují benchmarky. Deduplikace musí řešit přesné i přibližné kopie na úrovni dokumentů a fragmentů.

Jak se audituje předtrénovaný model bez přístupu k datům?

Používají se model cards, dokumentace poskytovatela, licenčná analýza, behaviorálne testy, skúšky memorování a doménové benchmarky. Nepriehladnost zůstává samostatným rizikem.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Google, Introduction to Large Language Models BERT, Pre-training of Deep Bidirectional Transformers

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.