Odborná definice
Odborná definice
Text classification přiřazuje textovému vstupu jednu nebo více tříd podle naučeného rozhodovacího pravidla. Vstupem může být věta, e-mail, dokument nebo konverzace, výstupem například téma, sentiment, závažnost či typ požadavky. Systém může používat řídké textové příznaky, embeddingy nebo transformer. Návrh musí určit taxonomii, možnost více štítků, práh rozhodnutí a postup pro texty mimo známých tříd. Taxonomie a mapování štítků se musí verziovat, protože změna významu třídy mění i interpretaci historických metrik.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Triedič podpory může prečítat správu zákazníka a zařadit ji mezi platbu, dopravu, reklamaci nebo technický problém. Najťažšia část často není model, ale definice kategorií. Pokud se prekrývají nebo jejich lidé označují nejednotne, model se učí nejasné pravidla. Při nasazení je třeba sledovat i nové typy otázek, které trénink nepoznal. Místo núteného zaradení může být bezpečnejšie vrátit nízkou istotu a poslat text člověku nebo do obecné kategorie. Provoz má ukladat i případy odoslané člověku, lebo právě ty ukazují vznik nových kategorií.
Časté otázky
Časté otázky
Jaký je rozdíl mezi single-label a multi-label klasifikací?
Single-label přiřadí přesně jednu třídu z množiny. Multi-label může aktivovat více nezávislých štítků, například reklamace, urgentné a firemný zákazník.
Jak se řeší nevyvážený počet tříd?
Používají se váhy ztráty, cielený sběr dat, resampling a metriky po jednotlivých třídách. Samotná accuracy může skrýt selhání malé, ale důležitej třídy.
Čím se hodnotí klasifikace textu?
Podle úlohy precision, recall, F1, ROC AUC, PR AUC a kalibrace. Při routingu se sleduje i podíl eskalací a provozní dopad konkrétních záměn.
Co je open-set problém?
Produkční text může patrit do třídy, která v tréninku neexistovala. Model potřebuje mechanismus nejistoty, detekci odlahlosti nebo bezpečnou fallback kategorii.
Musí klasifikátor používat velký jazykový model?
Ne. Při stabilní taxonómii a dostatku označených dat může být lineární model nebo menší encoder lacnejší a přesněji kontrolovatelný.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Hugging Face, Text Classification
- scikit-learn, Working With Text Data
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
