Jazykové modelování a pravděpodobnost

N-gramový jazykový model

N-gram model je pravděpodobnostní model sekvence, který odhaduje výskyt dalšího tokenu z pevne dlhého okna předchozích tokenů. Při bigrame využívá jeden předchozí prvek, při trigramoch dva. Pravděpodobnosti se získavají z početností v korpuse a upravují vyhladzováním, aby model vedel pracovat i s nepozorovanými kombinacemi. Model předpokládá Markovovu závislost obmedzeného rádu, proto dobře zachycuje lokálně vzory, ale neví přirozeně udržat vzdálený kontext.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-N-01

Odborná definice

Odborná definice

N-gram model je pravděpodobnostní model sekvence, který odhaduje výskyt dalšího tokenu z pevne dlhého okna předchozích tokenů. Při bigrame využívá jeden předchozí prvek, při trigramoch dva. Pravděpodobnosti se získavají z početností v korpuse a upravují vyhladzováním, aby model vedel pracovat i s nepozorovanými kombinacemi. Model předpokládá Markovovu závislost obmedzeného rádu, proto dobře zachycuje lokálně vzory, ale neví přirozeně udržat vzdálený kontext.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si systém, který doplňa slovo pouze podle několika slov tesne před kurzorom. Pokud v datech často videl spojení „strojové učení“, po slove „strojové“ přiřadí vysokou pravděpodobnost slovu „učení“. Nechápe však dokument jako celok a při dlhšej závislosti rychle ztrácí informaci. N-gramy jsou proto užitečné jako jednoduchý baseline, při kontrole pravopisu, odhade pravděpodobnosti textu nebo porovnávání s neurónovým modelem, ne jako plnohodnotná náhrada moderného LLM.

Časté otázky

Časté otázky

Co znamená číslo N v názve?

N určuje počet prvků v sledovanom úseku. Unigram pracuje s jedním tokenom, bigram s dvojicí a trigram s trojicou. Při predikci dalšího tokenu se využije nejvíce N mínus jeden předchozích tokenů.

Proč je třeba n-gramové pravděpodobnosti vyhladzovat?

Mnohé platné kombinace se v tréninkovém korpuse nikdy neobjavia. Bez vyhlazování by dostali nulovou pravděpodobnost a vynulovali by pravděpodobnost celé věty. Metody jako Kneser-Ney rozdělí část hmotnosti i nepozorovaným n-gramom.

Kdy se n-gram ještě vyplatí použít?

Je vhodný při malém výpočtovém rozpočte, transparentnom baseline, rychlé detekci fráz, jednoduchom jazykovém skórování nebo tam, kde má být rozhodování lahko reprodukovatelné a vysvetlitelné.

Jak se hodnotí n-gramový jazykový model?

Běžně se používá perplexita nebo průměrná negativní logaritmická vierohodnost na testovacom textu. Porovnání je zmysluplné jen při stejném tokenizéri, slovníku, datasete a spůsobe zpracování neznámých tokenů.

Proč vyšší N nemusí přinést lepší model?

S rastom N prudko roste počet možných kombinací a večšina z nich je v datech řídká. Vyšší rád může zachytit presnejšiu frázu, ale zároveň zvyšuje pameťové nároky a citlivost na chybějící pozorování.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Speech and Language Processing, N-gram Language Models

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.