Modely a architektúry · Jazykové modelovanie a pravdepodobnosť

N-gramový jazykový model

N-gram model

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-N-01

Odborná definícia

Význam a odborné vymedzenie pojmu

N-gram model je pravdepodobnostný model sekvencie, ktorý odhaduje výskyt ďalšieho tokenu z pevne dlhého okna predchádzajúcich tokenov. Pri bigrame využíva jeden predchádzajúci prvok, pri trigramoch dva. Pravdepodobnosti sa získavajú z početností v korpuse a upravujú vyhladzovaním, aby model vedel pracovať aj s nepozorovanými kombináciami. Model predpokladá Markovovu závislosť obmedzeného rádu, preto dobre zachytáva lokálne vzory, ale nevie prirodzene udržať vzdialený kontext.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Predstavte si systém, ktorý dopĺňa slovo iba podľa niekoľkých slov tesne pred kurzorom. Ak v dátach často videl spojenie „strojové učenie“, po slove „strojové“ priradí vysokú pravdepodobnosť slovu „učenie“. Nechápe však dokument ako celok a pri dlhšej závislosti rýchlo stráca informáciu. N-gramy sú preto užitočné ako jednoduchý baseline, pri kontrole pravopisu, odhade pravdepodobnosti textu alebo porovnávaní s neurónovým modelom, nie ako plnohodnotná náhrada moderného LLM.

Časté otázky

Otázky, ktoré spresňujú význam

Čo znamená číslo N v názve?

N určuje počet prvkov v sledovanom úseku. Unigram pracuje s jedným tokenom, bigram s dvojicou a trigram s trojicou. Pri predikcii ďalšieho tokenu sa využije najviac N mínus jeden predchádzajúcich tokenov.

Prečo treba n-gramové pravdepodobnosti vyhladzovať?

Mnohé platné kombinácie sa v tréningovom korpuse nikdy neobjavia. Bez vyhladzovania by dostali nulovú pravdepodobnosť a vynulovali by pravdepodobnosť celej vety. Metódy ako Kneser-Ney rozdelia časť hmotnosti aj nepozorovaným n-gramom.

Kedy sa n-gram ešte oplatí použiť?

Je vhodný pri malom výpočtovom rozpočte, transparentnom baseline, rýchlej detekcii fráz, jednoduchom jazykovom skórovaní alebo tam, kde má byť rozhodovanie ľahko reprodukovateľné a vysvetliteľné.

Ako sa hodnotí n-gramový jazykový model?

Bežne sa používa perplexita alebo priemerná negatívna logaritmická vierohodnosť na testovacom texte. Porovnanie je zmysluplné len pri rovnakom tokenizéri, slovníku, datasete a spôsobe spracovania neznámych tokenov.

Prečo vyššie N nemusí priniesť lepší model?

S rastom N prudko rastie počet možných kombinácií a väčšina z nich je v dátach riedka. Vyšší rád môže zachytiť presnejšiu frázu, ale zároveň zvyšuje pamäťové nároky a citlivosť na chýbajúce pozorovania.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Speech and Language Processing, N-gram Language Models

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.