Generatívne jazykové modelovanie

Causal language model

Kauzálny jazykový model

Causal language model je autoregresívny model trénovaný predikovať nasledujúci token iba z tokenov, ktoré mu v poradí predchádzajú. Kauzálna maska v attention mechanizme zabráni pozícii používať budúce tokeny počas tréningu, čím sa úloha zhoduje so sekvenčným generovaním. Pravdepodobnosť textu sa rozkladá na súčin podmienených pravdepodobností ďalších tokenov. Slovo causal tu označuje smer informačného toku v sekvencii, nie dôkaz príčinnej súvislosti v zmysle kauzálnej inferencie.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-C-06

Odborná definícia

Odborná definícia

Causal language model je autoregresívny model trénovaný predikovať nasledujúci token iba z tokenov, ktoré mu v poradí predchádzajú. Kauzálna maska v attention mechanizme zabráni pozícii používať budúce tokeny počas tréningu, čím sa úloha zhoduje so sekvenčným generovaním. Pravdepodobnosť textu sa rozkladá na súčin podmienených pravdepodobností ďalších tokenov. Slovo causal tu označuje smer informačného toku v sekvencii, nie dôkaz príčinnej súvislosti v zmysle kauzálnej inferencie.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Pri dopĺňaní vety model vidí všetko, čo už bolo napísané, ale nesmie sa pozrieť na slová, ktoré má ešte len uhádnuť. Po výbere ďalšieho tokenu sa tento token pridá do kontextu a proces pokračuje. Takto vzniká text krok za krokom. Počas tréningu možno stratu počítať pre mnoho pozícií naraz, pretože maska skryje budúcnosť každej pozície. Názov často mätie, model sa neučí, čo vo svete niečo spôsobilo. Učí sa jednosmernú podmienenú distribúciu tokenov a túto jazykovú pravidelnosť používa na tvorbu pokračovania.

Časté otázky

Časté otázky

Ako sa causal language model líši od masked language modelu?

Causal model predikuje ďalší token z ľavého kontextu a prirodzene generuje pokračovanie. Masked model obnovuje vybrané skryté tokeny s využitím kontextu z oboch strán. BERT je typický masked model, zatiaľ čo decoderové generátory používajú kauzálnu masku.

Prečo sa generovanie vykonáva sekvenčne?

Nový token závisí od všetkých predchádzajúcich vrátane tokenov, ktoré model práve vytvoril. Ďalší krok preto nemožno úplne vypočítať skôr. KV cache zrýchľuje opakované attention výpočty, ale základná autoregresívna závislosť zostáva.

Čo je teacher forcing pri tréningu?

Model dostáva ako kontext skutočné predchádzajúce tokeny z dát, nie vlastné predikcie. Umožňuje paralelne trénovať mnoho pozícií. Pri inferencii však model podmieňuje ďalší krok vlastnými výstupmi, čo vytvára rozdiel medzi tréningovým a generačným režimom.

Je výstup causal LM deterministický?

Nie nevyhnutne. Model poskytne distribúciu ďalšieho tokenu a dekodér môže zvoliť maximum alebo vzorkovať podľa teploty, top-p či iného pravidla. Rovnaký kontext preto môže vytvoriť odlišné pokračovania, ak je sampling stochastický.

Zaručuje vysoká pravdepodobnosť tokenu pravdivosť?

Nie. Pravdepodobnosť vyjadruje súlad s naučenou distribúciou textu v danom kontexte. Často opakované alebo jazykovo presvedčivé tvrdenie môže byť fakticky nesprávne. Overovanie zdrojov je samostatná vrstva aplikácie.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Hugging Face Transformers, Causal Language Modeling
  • Google Machine Learning Glossary

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.