Odborná definice
Význam a odborné vymezení pojmu
N-gram model je pravděpodobnostní model sekvence, který odhaduje výskyt dalšího tokenu z pevne dlhého okna předchozích tokenů. Při bigrame využívá jeden předchozí prvek, při trigramoch dva. Pravděpodobnosti se získavají z početností v korpuse a upravují vyhladzováním, aby model vedel pracovat i s nepozorovanými kombinacemi. Model předpokládá Markovovu závislost obmedzeného rádu, proto dobře zachycuje lokálně vzory, ale neví přirozeně udržat vzdálený kontext.
Srozumitelné vysvětlení
Jak se pojem používá v praxi
Představte si systém, který doplňa slovo pouze podle několika slov tesne před kurzorom. Pokud v datech často videl spojení „strojové učení“, po slove „strojové“ přiřadí vysokou pravděpodobnost slovu „učení“. Nechápe však dokument jako celok a při dlhšej závislosti rychle ztrácí informaci. N-gramy jsou proto užitečné jako jednoduchý baseline, při kontrole pravopisu, odhade pravděpodobnosti textu nebo porovnávání s neurónovým modelem, ne jako plnohodnotná náhrada moderného LLM.
Časté otázky
Otázky, které upřesňují význam
Co znamená číslo N v názve?
N určuje počet prvků v sledovanom úseku. Unigram pracuje s jedním tokenom, bigram s dvojicí a trigram s trojicou. Při predikci dalšího tokenu se využije nejvíce N mínus jeden předchozích tokenů.
Proč je třeba n-gramové pravděpodobnosti vyhladzovat?
Mnohé platné kombinace se v tréninkovém korpuse nikdy neobjavia. Bez vyhlazování by dostali nulovou pravděpodobnost a vynulovali by pravděpodobnost celé věty. Metody jako Kneser-Ney rozdělí část hmotnosti i nepozorovaným n-gramom.
Kdy se n-gram ještě vyplatí použít?
Je vhodný při malém výpočtovém rozpočte, transparentnom baseline, rychlé detekci fráz, jednoduchom jazykovém skórování nebo tam, kde má být rozhodování lahko reprodukovatelné a vysvetlitelné.
Jak se hodnotí n-gramový jazykový model?
Běžně se používá perplexita nebo průměrná negativní logaritmická vierohodnost na testovacom textu. Porovnání je zmysluplné jen při stejném tokenizéri, slovníku, datasete a spůsobe zpracování neznámých tokenů.
Proč vyšší N nemusí přinést lepší model?
S rastom N prudko roste počet možných kombinací a večšina z nich je v datech řídká. Vyšší rád může zachytit presnejšiu frázu, ale zároveň zvyšuje pameťové nároky a citlivost na chybějící pozorování.
Související pojmy
Významové a tematické souvislosti
Zdroje a redakční stopa
Použitá východiska a odborná revize
- Speech and Language Processing, N-gram Language Models
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
