Generativní a jazyková AI · Jazykové modelování a pravděpodobnost

N-gramový jazykový model

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-N-01

Odborná definice

Význam a odborné vymezení pojmu

N-gram model je pravděpodobnostní model sekvence, který odhaduje výskyt dalšího tokenu z pevne dlhého okna předchozích tokenů. Při bigrame využívá jeden předchozí prvek, při trigramoch dva. Pravděpodobnosti se získavají z početností v korpuse a upravují vyhladzováním, aby model vedel pracovat i s nepozorovanými kombinacemi. Model předpokládá Markovovu závislost obmedzeného rádu, proto dobře zachycuje lokálně vzory, ale neví přirozeně udržat vzdálený kontext.

Srozumitelné vysvětlení

Jak se pojem používá v praxi

Představte si systém, který doplňa slovo pouze podle několika slov tesne před kurzorom. Pokud v datech často videl spojení „strojové učení“, po slove „strojové“ přiřadí vysokou pravděpodobnost slovu „učení“. Nechápe však dokument jako celok a při dlhšej závislosti rychle ztrácí informaci. N-gramy jsou proto užitečné jako jednoduchý baseline, při kontrole pravopisu, odhade pravděpodobnosti textu nebo porovnávání s neurónovým modelem, ne jako plnohodnotná náhrada moderného LLM.

Časté otázky

Otázky, které upřesňují význam

Co znamená číslo N v názve?

N určuje počet prvků v sledovanom úseku. Unigram pracuje s jedním tokenom, bigram s dvojicí a trigram s trojicou. Při predikci dalšího tokenu se využije nejvíce N mínus jeden předchozích tokenů.

Proč je třeba n-gramové pravděpodobnosti vyhladzovat?

Mnohé platné kombinace se v tréninkovém korpuse nikdy neobjavia. Bez vyhlazování by dostali nulovou pravděpodobnost a vynulovali by pravděpodobnost celé věty. Metody jako Kneser-Ney rozdělí část hmotnosti i nepozorovaným n-gramom.

Kdy se n-gram ještě vyplatí použít?

Je vhodný při malém výpočtovém rozpočte, transparentnom baseline, rychlé detekci fráz, jednoduchom jazykovém skórování nebo tam, kde má být rozhodování lahko reprodukovatelné a vysvetlitelné.

Jak se hodnotí n-gramový jazykový model?

Běžně se používá perplexita nebo průměrná negativní logaritmická vierohodnost na testovacom textu. Porovnání je zmysluplné jen při stejném tokenizéri, slovníku, datasete a spůsobe zpracování neznámých tokenů.

Proč vyšší N nemusí přinést lepší model?

S rastom N prudko roste počet možných kombinací a večšina z nich je v datech řídká. Vyšší rád může zachytit presnejšiu frázu, ale zároveň zvyšuje pameťové nároky a citlivost na chybějící pozorování.

Související pojmy

Významové a tematické souvislosti

Zdroje a redakční stopa

Použitá východiska a odborná revize

  • Speech and Language Processing, N-gram Language Models

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.