Odborná definícia
Odborná definícia
N-gram model je pravdepodobnostný model sekvencie, ktorý odhaduje výskyt ďalšieho tokenu z pevne dlhého okna predchádzajúcich tokenov. Pri bigrame využíva jeden predchádzajúci prvok, pri trigramoch dva. Pravdepodobnosti sa získavajú z početností v korpuse a upravujú vyhladzovaním, aby model vedel pracovať aj s nepozorovanými kombináciami. Model predpokladá Markovovu závislosť obmedzeného rádu, preto dobre zachytáva lokálne vzory, ale nevie prirodzene udržať vzdialený kontext.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Predstavte si systém, ktorý dopĺňa slovo iba podľa niekoľkých slov tesne pred kurzorom. Ak v dátach často videl spojenie „strojové učenie“, po slove „strojové“ priradí vysokú pravdepodobnosť slovu „učenie“. Nechápe však dokument ako celok a pri dlhšej závislosti rýchlo stráca informáciu. N-gramy sú preto užitočné ako jednoduchý baseline, pri kontrole pravopisu, odhade pravdepodobnosti textu alebo porovnávaní s neurónovým modelom, nie ako plnohodnotná náhrada moderného LLM.
Časté otázky
Časté otázky
Čo znamená číslo N v názve?
N určuje počet prvkov v sledovanom úseku. Unigram pracuje s jedným tokenom, bigram s dvojicou a trigram s trojicou. Pri predikcii ďalšieho tokenu sa využije najviac N mínus jeden predchádzajúcich tokenov.
Prečo treba n-gramové pravdepodobnosti vyhladzovať?
Mnohé platné kombinácie sa v tréningovom korpuse nikdy neobjavia. Bez vyhladzovania by dostali nulovú pravdepodobnosť a vynulovali by pravdepodobnosť celej vety. Metódy ako Kneser-Ney rozdelia časť hmotnosti aj nepozorovaným n-gramom.
Kedy sa n-gram ešte oplatí použiť?
Je vhodný pri malom výpočtovom rozpočte, transparentnom baseline, rýchlej detekcii fráz, jednoduchom jazykovom skórovaní alebo tam, kde má byť rozhodovanie ľahko reprodukovateľné a vysvetliteľné.
Ako sa hodnotí n-gramový jazykový model?
Bežne sa používa perplexita alebo priemerná negatívna logaritmická vierohodnosť na testovacom texte. Porovnanie je zmysluplné len pri rovnakom tokenizéri, slovníku, datasete a spôsobe spracovania neznámych tokenov.
Prečo vyššie N nemusí priniesť lepší model?
S rastom N prudko rastie počet možných kombinácií a väčšina z nich je v dátach riedka. Vyšší rád môže zachytiť presnejšiu frázu, ale zároveň zvyšuje pamäťové nároky a citlivosť na chýbajúce pozorovania.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Speech and Language Processing, N-gram Language Models
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
