Generativní jazykové modelování

Kauzální jazykový model

Causal language model je autoregresivní model trénovaný predikovat následující token pouze z tokenů, které mu v poradí predchádzají. Kauzální maska v attention mechanizme zabrání pozici používat budoucí tokeny během tréninku, čím se úloha zhoduje se sekvenčným generováním. Pravděpodobnost textu se rozkladá na součin podmienených pravděpodobností dalších tokenů. Slovo causal tu označuje směr informačního toku v sekvenci, ne důkaz príčinnej souvislosti v smyslu kauzálnej inference.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-C-06

Odborná definice

Odborná definice

Causal language model je autoregresivní model trénovaný predikovat následující token pouze z tokenů, které mu v poradí predchádzají. Kauzální maska v attention mechanizme zabrání pozici používat budoucí tokeny během tréninku, čím se úloha zhoduje se sekvenčným generováním. Pravděpodobnost textu se rozkladá na součin podmienených pravděpodobností dalších tokenů. Slovo causal tu označuje směr informačního toku v sekvenci, ne důkaz príčinnej souvislosti v smyslu kauzálnej inference.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Při doplňaní věty model vidí vše, co už bylo napísané, ale nesmí se podívat na slova, které má ještě jen uhádnuť. Po výběru dalšího tokenu se tento token přidá do kontextu a proces pokračuje. Takto vzniká text krok za krokom. Během tréninku lze ztrátu počítat pro mnoho pozic najednou, protože maska skryje budúcnost každé pozice. Název často metie, model se neučí, co ve svete něco způsobilo. Učí se jednosmernou podmienenou distribuci tokenů a tuto jazykovou pravidelnost používá na tvorbu pokračování.

Časté otázky

Časté otázky

Jak se causal language model liší od masked language modelu?

Causal model predikuje další token z lavého kontextu a přirozeně generuje pokračování. Masked model obnovuje vybrané skryté tokeny s využitím kontextu z obou strán. BERT je typický masked model, zatímco decoderové generátory používají kauzálnu masku.

Proč se generování provádí sekvenčne?

Nový token závisí na všech předchozích včetně tokenů, které model právě vytvořil. Další krok proto nelze zcela vypočítat dříve. KV cache zrýchluje opakované attention výpočty, ale základní autoregresívna závislost zůstává.

Co je teacher forcing při tréninku?

Model dostává jako kontext skutečné předchozí tokeny z dat, ne vlastní predikce. Umožňuje paralelně trénovat mnoho pozic. Při inferenci však model podmieňuje další krok vlastnými výstupy, co vytváří rozdíl mezi tréninkovým a generačným režimom.

Je výstup causal LM deterministický?

Ne nevyhnutelně. Model poskytne distribuci dalšího tokenu a dekodér může zvolit maximum nebo vzorkovat podle teploty, top-p či jiného pravidla. Stejný kontext proto může vytvořit odlišné pokračování, pokud je sampling stochastický.

Zaručuje vysoká pravděpodobnost tokenu pravdivost?

Ne. Pravděpodobnost vyjadřuje soulad s naučenou distribúcí textu v daném kontextu. Často opakované nebo jazykovo přesvědčivé tvrzení může být fakticky nesprávně. Overování zdrojů je samostatná vrstva aplikace.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Hugging Face Transformers, Causal Language Modeling
  • Google Machine Learning Glossary

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.