Odborná definice
Odborná definice
Language model je pravděpodobnostní nebo skórovací model, který zachycuje strukturu sekvencí jazykových jednotek, například znaků, slov nebo tokenů. Autoregresivní model odhaduje pravděpodobnost dalšího tokenu vzhledem na předchozí kontext, maskovaný model rekonštruuje skryté části a sekvenčno-sekvenční model podmieňuje výstup dalším vstupem. Jazykový model může být statistický i neuronový. Jeho pravdepodobnostná plynulosť neznamená automaticky faktickou správnost ani porozumění sveta.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Jazykový model se učí, jaké pokračování jsou v daném kontextu pravdepodobné. Po slovech „hlavní mesto Slovenska je“ pridelí vysoké skóre tokenom tvoriacim Bratislava, protože podobný vzor videl v datech. Stejný mechanismus však může vytvořit gramaticky presvedčivou nepravdu, když chybí spolehlivý faktický základ. Ne každý jazykový model je obrovský chatbot. Může jít i o malý model na doplňání klávesnice, rozpoznávání řeči, hodnocení překladu nebo detekci nezvyčajných vět.
Časté otázky
Časté otázky
Co přesně jazykový model predpovedá?
Nejčastěji pravděpodobnost tokenu nebo celé sekvence. Konkrétní cíl závisí na tréninkové úlohy, například next-token prediction nebo masked token prediction.
Je perplexita mírou pravdivosti?
Ne. Perplexita vyjadřuje, jako dobře model predikuje tokeny v korpuse. Text může být jazykovo pravdepodobný a zároveň vecne nesprávný.
Může model pracovat bez slovníka celých slov?
Ano. Moderní systémy často používají subword tokeny nebo bajty, které umožňují skladat neznámé slova z menších jednotek.
Jak se jazykový model liší od embedding modelu?
Jazykový model hodnotí nebo generuje sekvence. Embedding model primárně mapuje vstup na vektor vhodný pro podobnost, klasifikaci či vyhledávání.
Proč záleží na kontextovom okne?
Určuje, kolik tokenů může model při výpočtu zohladnit. Déle okno zvyšuje dostupný kontext, ne zaručenou schopnost využit každý detail.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Google Machine Learning Glossary, language model
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
