Odborná definícia
Význam a odborné vymedzenie pojmu
N-gram model je pravdepodobnostný model sekvencie, ktorý odhaduje výskyt ďalšieho tokenu z pevne dlhého okna predchádzajúcich tokenov. Pri bigrame využíva jeden predchádzajúci prvok, pri trigramoch dva. Pravdepodobnosti sa získavajú z početností v korpuse a upravujú vyhladzovaním, aby model vedel pracovať aj s nepozorovanými kombináciami. Model predpokladá Markovovu závislosť obmedzeného rádu, preto dobre zachytáva lokálne vzory, ale nevie prirodzene udržať vzdialený kontext.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Predstavte si systém, ktorý dopĺňa slovo iba podľa niekoľkých slov tesne pred kurzorom. Ak v dátach často videl spojenie „strojové učenie“, po slove „strojové“ priradí vysokú pravdepodobnosť slovu „učenie“. Nechápe však dokument ako celok a pri dlhšej závislosti rýchlo stráca informáciu. N-gramy sú preto užitočné ako jednoduchý baseline, pri kontrole pravopisu, odhade pravdepodobnosti textu alebo porovnávaní s neurónovým modelom, nie ako plnohodnotná náhrada moderného LLM.
Časté otázky
Otázky, ktoré spresňujú význam
Čo znamená číslo N v názve?
N určuje počet prvkov v sledovanom úseku. Unigram pracuje s jedným tokenom, bigram s dvojicou a trigram s trojicou. Pri predikcii ďalšieho tokenu sa využije najviac N mínus jeden predchádzajúcich tokenov.
Prečo treba n-gramové pravdepodobnosti vyhladzovať?
Mnohé platné kombinácie sa v tréningovom korpuse nikdy neobjavia. Bez vyhladzovania by dostali nulovú pravdepodobnosť a vynulovali by pravdepodobnosť celej vety. Metódy ako Kneser-Ney rozdelia časť hmotnosti aj nepozorovaným n-gramom.
Kedy sa n-gram ešte oplatí použiť?
Je vhodný pri malom výpočtovom rozpočte, transparentnom baseline, rýchlej detekcii fráz, jednoduchom jazykovom skórovaní alebo tam, kde má byť rozhodovanie ľahko reprodukovateľné a vysvetliteľné.
Ako sa hodnotí n-gramový jazykový model?
Bežne sa používa perplexita alebo priemerná negatívna logaritmická vierohodnosť na testovacom texte. Porovnanie je zmysluplné len pri rovnakom tokenizéri, slovníku, datasete a spôsobe spracovania neznámych tokenov.
Prečo vyššie N nemusí priniesť lepší model?
S rastom N prudko rastie počet možných kombinácií a väčšina z nich je v dátach riedka. Vyšší rád môže zachytiť presnejšiu frázu, ale zároveň zvyšuje pamäťové nároky a citlivosť na chýbajúce pozorovania.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Speech and Language Processing, N-gram Language Models
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
