Generatívna a jazyková AI · Spracovanie prirodzeného jazyka

Klasifikácia textu

Text classification

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-10

Odborná definícia

Význam a odborné vymedzenie pojmu

Text classification priraďuje textovému vstupu jednu alebo viac tried podľa naučeného rozhodovacieho pravidla. Vstupom môže byť veta, e-mail, dokument alebo konverzácia, výstupom napríklad téma, sentiment, závažnosť či typ požiadavky. Systém môže používať riedke textové príznaky, embeddingy alebo transformer. Návrh musí určiť taxonómiu, možnosť viacerých štítkov, prah rozhodnutia a postup pre texty mimo známych tried. Taxonómia a mapovanie štítkov sa musia verziovať, pretože zmena významu triedy mení aj interpretáciu historických metrík.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Triedič podpory môže prečítať správu zákazníka a zaradiť ju medzi platbu, dopravu, reklamáciu alebo technický problém. Najťažšia časť často nie je model, ale definícia kategórií. Ak sa prekrývajú alebo ich ľudia označujú nejednotne, model sa učí nejasné pravidlá. Pri nasadení treba sledovať aj nové typy otázok, ktoré tréning nepoznal. Namiesto núteného zaradenia môže byť bezpečnejšie vrátiť nízku istotu a poslať text človeku alebo do všeobecnej kategórie. Prevádzka má ukladať aj prípady odoslané človeku, lebo práve tie ukazujú vznik nových kategórií.

Časté otázky

Otázky, ktoré spresňujú význam

Aký je rozdiel medzi single-label a multi-label klasifikáciou?

Single-label priradí presne jednu triedu z množiny. Multi-label môže aktivovať viac nezávislých štítkov, napríklad reklamácia, urgentné a firemný zákazník.

Ako sa rieši nevyvážený počet tried?

Používajú sa váhy straty, cielený zber dát, resampling a metriky po jednotlivých triedach. Samotná accuracy môže skryť zlyhanie malej, ale dôležitej triedy.

Čím sa hodnotí klasifikácia textu?

Podľa úlohy precision, recall, F1, ROC AUC, PR AUC a kalibrácia. Pri routingu sa sleduje aj podiel eskalácií a prevádzkový dopad konkrétnych zámen.

Čo je open-set problém?

Produkčný text môže patriť do triedy, ktorá v tréningu neexistovala. Model potrebuje mechanizmus neistoty, detekciu odľahlosti alebo bezpečnú fallback kategóriu.

Musí klasifikátor používať veľký jazykový model?

Nie. Pri stabilnej taxonómii a dostatku označených dát môže byť lineárny model alebo menší encoder lacnejší a presnejšie kontrolovateľný.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Hugging Face, Text Classification
  • scikit-learn, Working With Text Data

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.