Sekvenční označování textu

klasifikace jednotlivých tokenů

Token classification přiřazuje štítek každému tokenu nebo vybranému úseku vstupní sekvence. Používá se při rozpoznávání pomenovaných entít, označování slovních druhů, detekci citlivých údajů nebo extrakcii struktury. Při subword tokenizaci je třeba previesť anotace slov na více tokenů a následně spojit predikce zpět do textových rozsahů. Kvalita závisí na konzistence hranic entít, schémata štítků a hodnocení na úrovni celých entít, ne pouze tokenů. Anotačný manuál musí obsahovat hraniční případy, vnorené entity a pravidla pro interpunkci či zkratky.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-17

Odborná definice

Odborná definice

Token classification přiřazuje štítek každému tokenu nebo vybranému úseku vstupní sekvence. Používá se při rozpoznávání pomenovaných entít, označování slovních druhů, detekci citlivých údajů nebo extrakcii struktury. Při subword tokenizaci je třeba previesť anotace slov na více tokenů a následně spojit predikce zpět do textových rozsahů. Kvalita závisí na konzistence hranic entít, schémata štítků a hodnocení na úrovni celých entít, ne pouze tokenů. Anotačný manuál musí obsahovat hraniční případy, vnorené entity a pravidla pro interpunkci či zkratky.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Ve vete „Miroslav pracuje v Bratislave“ může model označit první jméno jako osobu a posledné slovo jako místo. Problém vznikne, když tokenizer rozdělí jedno jméno na více kúsků. Tréninková štítky se musí zarovnat s týmito kúskami a při výstupu znovu spojit. Nestačí správně označit večšinu tokenů, pokud model špatně určí začiatok nebo koniec názvu firmy. Proto se při NER měří shoda celé entity a jasně se stanoví, zda se vyžaduje přesná nebo čiastočná hranice. Dvě správně rozpoznané slova ještě netvoria správnou entitu, pokud model pridal nebo vynechal důležitou část názvu.

Časté otázky

Časté otázky

Jak se token classification liší od text classification?

Text classification dává štítek celé sekvenci. Token classification vytváří štítek pro jednotlivé pozice, takže dokáže lokalizovat konkrétní výraz nebo entitu.

Co znamená schéma BIO?

B označuje začiatok entity, I její pokračování a O token mimo entity. Rozšířené schémata přidávají osobitné značky pro koniec nebo jedno-tokenovou entitu.

Jak se řeší subword tokeny?

Štítek slova se přiřadí prvému subwordu nebo všem jeho častiam podle tréninkového protokolu. Při vyhodnotení se predikce mapují zpět na původní znaky.

Proč tokenová accuracy klame?

Večšina tokenů může patrit do třídy O. Model potom dosáhne vysokou accuracy i při slabom rozpoznávání entít, proto se používá entity-level precision, recall a F1.

Jak se řeší prekrývajúce se entity?

Jedna jednoduchá BIO vrstva jejich neví vyjadrit. Potřebný je span model, více vrstev štítků nebo strukturovaný extrakčný přístup s explicitnými rozsahmi.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Hugging Face, Token Classification BERT: Pre-training of Deep Bidirectional Transformers

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.