Odborná definícia
Význam a odborné vymedzenie pojmu
Text classification priraďuje textovému vstupu jednu alebo viac tried podľa naučeného rozhodovacieho pravidla. Vstupom môže byť veta, e-mail, dokument alebo konverzácia, výstupom napríklad téma, sentiment, závažnosť či typ požiadavky. Systém môže používať riedke textové príznaky, embeddingy alebo transformer. Návrh musí určiť taxonómiu, možnosť viacerých štítkov, prah rozhodnutia a postup pre texty mimo známych tried. Taxonómia a mapovanie štítkov sa musia verziovať, pretože zmena významu triedy mení aj interpretáciu historických metrík.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Triedič podpory môže prečítať správu zákazníka a zaradiť ju medzi platbu, dopravu, reklamáciu alebo technický problém. Najťažšia časť často nie je model, ale definícia kategórií. Ak sa prekrývajú alebo ich ľudia označujú nejednotne, model sa učí nejasné pravidlá. Pri nasadení treba sledovať aj nové typy otázok, ktoré tréning nepoznal. Namiesto núteného zaradenia môže byť bezpečnejšie vrátiť nízku istotu a poslať text človeku alebo do všeobecnej kategórie. Prevádzka má ukladať aj prípady odoslané človeku, lebo práve tie ukazujú vznik nových kategórií.
Časté otázky
Otázky, ktoré spresňujú význam
Aký je rozdiel medzi single-label a multi-label klasifikáciou?
Single-label priradí presne jednu triedu z množiny. Multi-label môže aktivovať viac nezávislých štítkov, napríklad reklamácia, urgentné a firemný zákazník.
Ako sa rieši nevyvážený počet tried?
Používajú sa váhy straty, cielený zber dát, resampling a metriky po jednotlivých triedach. Samotná accuracy môže skryť zlyhanie malej, ale dôležitej triedy.
Čím sa hodnotí klasifikácia textu?
Podľa úlohy precision, recall, F1, ROC AUC, PR AUC a kalibrácia. Pri routingu sa sleduje aj podiel eskalácií a prevádzkový dopad konkrétnych zámen.
Čo je open-set problém?
Produkčný text môže patriť do triedy, ktorá v tréningu neexistovala. Model potrebuje mechanizmus neistoty, detekciu odľahlosti alebo bezpečnú fallback kategóriu.
Musí klasifikátor používať veľký jazykový model?
Nie. Pri stabilnej taxonómii a dostatku označených dát môže byť lineárny model alebo menší encoder lacnejší a presnejšie kontrolovateľný.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Hugging Face, Text Classification
- scikit-learn, Working With Text Data
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
