Odborná definice
Odborná definice
Causal language model je autoregresivní model trénovaný predikovat následující token pouze z tokenů, které mu v poradí predchádzají. Kauzální maska v attention mechanizme zabrání pozici používat budoucí tokeny během tréninku, čím se úloha zhoduje se sekvenčným generováním. Pravděpodobnost textu se rozkladá na součin podmienených pravděpodobností dalších tokenů. Slovo causal tu označuje směr informačního toku v sekvenci, ne důkaz príčinnej souvislosti v smyslu kauzálnej inference.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Při doplňaní věty model vidí vše, co už bylo napísané, ale nesmí se podívat na slova, které má ještě jen uhádnuť. Po výběru dalšího tokenu se tento token přidá do kontextu a proces pokračuje. Takto vzniká text krok za krokom. Během tréninku lze ztrátu počítat pro mnoho pozic najednou, protože maska skryje budúcnost každé pozice. Název často metie, model se neučí, co ve svete něco způsobilo. Učí se jednosmernou podmienenou distribuci tokenů a tuto jazykovou pravidelnost používá na tvorbu pokračování.
Časté otázky
Časté otázky
Jak se causal language model liší od masked language modelu?
Causal model predikuje další token z lavého kontextu a přirozeně generuje pokračování. Masked model obnovuje vybrané skryté tokeny s využitím kontextu z obou strán. BERT je typický masked model, zatímco decoderové generátory používají kauzálnu masku.
Proč se generování provádí sekvenčne?
Nový token závisí na všech předchozích včetně tokenů, které model právě vytvořil. Další krok proto nelze zcela vypočítat dříve. KV cache zrýchluje opakované attention výpočty, ale základní autoregresívna závislost zůstává.
Co je teacher forcing při tréninku?
Model dostává jako kontext skutečné předchozí tokeny z dat, ne vlastní predikce. Umožňuje paralelně trénovat mnoho pozic. Při inferenci však model podmieňuje další krok vlastnými výstupy, co vytváří rozdíl mezi tréninkovým a generačným režimom.
Je výstup causal LM deterministický?
Ne nevyhnutelně. Model poskytne distribuci dalšího tokenu a dekodér může zvolit maximum nebo vzorkovat podle teploty, top-p či jiného pravidla. Stejný kontext proto může vytvořit odlišné pokračování, pokud je sampling stochastický.
Zaručuje vysoká pravděpodobnost tokenu pravdivost?
Ne. Pravděpodobnost vyjadřuje soulad s naučenou distribúcí textu v daném kontextu. Často opakované nebo jazykovo přesvědčivé tvrzení může být fakticky nesprávně. Overování zdrojů je samostatná vrstva aplikace.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Hugging Face Transformers, Causal Language Modeling
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
