Supervidované strojové učení

Klasifikace

Classification je úloha, při které model přiřazuje vstupu jednu nebo více diskrétnych tříd. Může být binární, multiclass nebo multilabel a výstupem bývá skóre či pravdepodobnostná distribuce, ze které rozhodovací pravidlo vytvoří štítek. Model se učí z označených příkladů a hodnotí na datech oddelených od tréninku. Kvalita závisí na definice tříd, reprezentativnosti dat, ztrátové funkce, prahu a nákladů chyb. Klasifikace nepredpovedá automaticky príčinu ani budúcu číselnou hodnotu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-C-12

Odborná definice

Odborná definice

Classification je úloha, při které model přiřazuje vstupu jednu nebo více diskrétnych tříd. Může být binární, multiclass nebo multilabel a výstupem bývá skóre či pravdepodobnostná distribuce, ze které rozhodovací pravidlo vytvoří štítek. Model se učí z označených příkladů a hodnotí na datech oddelených od tréninku. Kvalita závisí na definice tříd, reprezentativnosti dat, ztrátové funkce, prahu a nákladů chyb. Klasifikace nepredpovedá automaticky príčinu ani budúcu číselnou hodnotu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

E-mailový filtr může každou správu zařadit jako spam nebo legitímnu, obrázek může dostat jednu třídu zvieraťa a článek více tém najednou. Ve všech případech musí být nejprve jasné, co třídy znamenají a jak se řeší hraniční situace. Model často nevydá pouze název, ale skóre pro každou možnost. Aplikace potom zvolí pravidlo, například automaticky blokovat jen vysoké riziko a neisté případy poslat člověku. Úspěch proto neurčuje jediná accuracy, ale chování při konkrétních chybách a segmentech.

Časté otázky

Časté otázky

Jaký je rozdíl mezi multiclass a multilabel klasifikací?

Při multiclass úloze patří příklad zpravidla do jedné z navzájem se vylučujúcich tříd. Při multilabel může mít současně více štítků, například článek technologie i právo. Architektura výstupu, ztráta a metriky se proto liší.

Co je decision boundary?

Hranice v prostoru příznaků, na které se mění predikovaná třída. Jednoduchý lineární model vytváří hyperrovinu, hluboká síť může vytvořit komplexný tvar. Hranice naučená mimo oblastí pokrytých daty nemusí mít spolehlivý význam.

Proč je třeba oddělit tréninková a testovací data?

Model se může přizpůsobit konkrétnym příkladem a preprocessingovým rozhodnutiam. Nezávislá testovací sada odhaduje výkon na nových datech. Pokud stejný uživatel, dokument nebo časové období prenikne do obou částí, výsledek bývá nadhodnotený.

Jak se vybírá vhodná metrika?

Podle rozhodnutí a ceny omylů. Při vyvážených třídách může pomoci accuracy, při zriedkavom riziku precision, recall a PR AUC. Multiclass úlohy potřebují macro nebo weighted agregaci a kontrolu výsledků každé třídy.

Co je abstention nebo reject option?

Model se při nízké istote nerozhodne a případ odevzdá jinému systému nebo člověku. Takový mechanismus může zvýšit bezpečnost, ale snižuje automatizačné pokrytí. Práh odmítnutí se testuje podle kapacity a kritickosti procesu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Google Machine Learning Crash Course, Classification

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.