Odborná definice
Odborná definice
Token classification přiřazuje štítek každému tokenu nebo vybranému úseku vstupní sekvence. Používá se při rozpoznávání pomenovaných entít, označování slovních druhů, detekci citlivých údajů nebo extrakcii struktury. Při subword tokenizaci je třeba previesť anotace slov na více tokenů a následně spojit predikce zpět do textových rozsahů. Kvalita závisí na konzistence hranic entít, schémata štítků a hodnocení na úrovni celých entít, ne pouze tokenů. Anotačný manuál musí obsahovat hraniční případy, vnorené entity a pravidla pro interpunkci či zkratky.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Ve vete „Miroslav pracuje v Bratislave“ může model označit první jméno jako osobu a posledné slovo jako místo. Problém vznikne, když tokenizer rozdělí jedno jméno na více kúsků. Tréninková štítky se musí zarovnat s týmito kúskami a při výstupu znovu spojit. Nestačí správně označit večšinu tokenů, pokud model špatně určí začiatok nebo koniec názvu firmy. Proto se při NER měří shoda celé entity a jasně se stanoví, zda se vyžaduje přesná nebo čiastočná hranice. Dvě správně rozpoznané slova ještě netvoria správnou entitu, pokud model pridal nebo vynechal důležitou část názvu.
Časté otázky
Časté otázky
Jak se token classification liší od text classification?
Text classification dává štítek celé sekvenci. Token classification vytváří štítek pro jednotlivé pozice, takže dokáže lokalizovat konkrétní výraz nebo entitu.
Co znamená schéma BIO?
B označuje začiatok entity, I její pokračování a O token mimo entity. Rozšířené schémata přidávají osobitné značky pro koniec nebo jedno-tokenovou entitu.
Jak se řeší subword tokeny?
Štítek slova se přiřadí prvému subwordu nebo všem jeho častiam podle tréninkového protokolu. Při vyhodnotení se predikce mapují zpět na původní znaky.
Proč tokenová accuracy klame?
Večšina tokenů může patrit do třídy O. Model potom dosáhne vysokou accuracy i při slabom rozpoznávání entít, proto se používá entity-level precision, recall a F1.
Jak se řeší prekrývajúce se entity?
Jedna jednoduchá BIO vrstva jejich neví vyjadrit. Potřebný je span model, více vrstev štítků nebo strukturovaný extrakčný přístup s explicitnými rozsahmi.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Hugging Face, Token Classification BERT: Pre-training of Deep Bidirectional Transformers
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
