Odborná definícia
Odborná definícia
Token classification priraďuje štítok každému tokenu alebo vybranému úseku vstupnej sekvencie. Používa sa pri rozpoznávaní pomenovaných entít, označovaní slovných druhov, detekcii citlivých údajov alebo extrakcii štruktúry. Pri subword tokenizácii treba previesť anotácie slov na viac tokenov a následne spojiť predikcie späť do textových rozsahov. Kvalita závisí od konzistencie hraníc entít, schémy štítkov a hodnotenia na úrovni celých entít, nie iba tokenov. Anotačný manuál musí obsahovať hraničné prípady, vnorené entity a pravidlá pre interpunkciu či skratky.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Vo vete „Miroslav pracuje v Bratislave“ môže model označiť prvé meno ako osobu a posledné slovo ako miesto. Problém vznikne, keď tokenizer rozdelí jedno meno na viac kúskov. Tréningové štítky sa musia zarovnať s týmito kúskami a pri výstupe znovu spojiť. Nestačí správne označiť väčšinu tokenov, ak model zle určí začiatok alebo koniec názvu firmy. Preto sa pri NER meria zhoda celej entity a jasne sa stanoví, či sa vyžaduje presná alebo čiastočná hranica. Dve správne rozpoznané slová ešte netvoria správnu entitu, ak model pridal alebo vynechal dôležitú časť názvu.
Časté otázky
Časté otázky
Ako sa token classification líši od text classification?
Text classification dáva štítok celej sekvencii. Token classification vytvára štítok pre jednotlivé pozície, takže dokáže lokalizovať konkrétny výraz alebo entitu.
Čo znamená schéma BIO?
B označuje začiatok entity, I jej pokračovanie a O token mimo entity. Rozšírené schémy pridávajú osobitné značky pre koniec alebo jedno-tokenovú entitu.
Ako sa riešia subword tokeny?
Štítok slova sa priradí prvému subwordu alebo všetkým jeho častiam podľa tréningového protokolu. Pri vyhodnotení sa predikcie mapujú späť na pôvodné znaky.
Prečo tokenová accuracy klame?
Väčšina tokenov môže patriť do triedy O. Model potom dosiahne vysokú accuracy aj pri slabom rozpoznávaní entít, preto sa používa entity-level precision, recall a F1.
Ako sa riešia prekrývajúce sa entity?
Jedna jednoduchá BIO vrstva ich nevie vyjadriť. Potrebný je span model, viac vrstiev štítkov alebo štruktúrovaný extrakčný prístup s explicitnými rozsahmi.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Hugging Face, Token Classification BERT: Pre-training of Deep Bidirectional Transformers
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
