Metriky klasifikace

Makro F1 skóre

Macro F1 score vypočítá F1 skóre samostatně pro každou třídu a následně vytvoří jejich nevážený aritmetický průměr. Každá třída tedy ovlivňuje výsledek stejně bez ohladu na počet její vzorků. Metrika kombinuje precision a recall harmonickým průměrem na úrovni jednotlivých tříd a je citlivá na slabý výkon při menšinových kategóriách. Při třídě bez predikovaných nebo skutečných pozitív závisí výsledek od konvence implementace a nastavení nulového dělení.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-M-05

Odborná definice

Odborná definice

Macro F1 score vypočítá F1 skóre samostatně pro každou třídu a následně vytvoří jejich nevážený aritmetický průměr. Každá třída tedy ovlivňuje výsledek stejně bez ohladu na počet její vzorků. Metrika kombinuje precision a recall harmonickým průměrem na úrovni jednotlivých tříd a je citlivá na slabý výkon při menšinových kategóriách. Při třídě bez predikovaných nebo skutečných pozitív závisí výsledek od konvence implementace a nastavení nulového dělení.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si klasifikátor, který rozpoznáva deset typů porúch, přičemž jedna porucha tvoří večšinu dat. Pokud by jsme všechny případy spočítali spolu, dobrý výkon na dominantnej třídě by mohl zakrýt selhání na vzácných poruchách. Macro F1 nejprve ohodnotí každou třídu zvlášť a až potom výsledky spriemeruje. Vzácna kritická porucha má proto stejnou váhu jako běžný stav. To je užitečné při nevyvážených třídách, ale výsledek může výrazně kolísat, pokud má niektorá třída velmi málo příkladů.

Časté otázky

Časté otázky

Kdy je Macro F1 vhodnější než accuracy?

Když jsou třídy nevyvážené a záleží na výkone každé z nich. Accuracy může být vysoká i při úplnom ignorování malé, ale důležitej třídy.

Jak se Macro F1 liší od weighted F1?

Macro F1 dává každé třídě stejnou váhu. Weighted F1 váží třídní skóre podle počtu skutečných vzorků, takže dominantné třídy vplývají více.

Může být Macro F1 vysoké při zlom celkovom počtu chyb?

Ano, pokud jsou třídy malé a vyrovnané v relatívnom výkone, nevážený průměr nemusí odrážat absolútny počet chybných rozhodnutí v provozu.

Co se stane, pokud model nikdy nepredikuje jednu třídu?

Precision nebo recall pro tuto třídu může být nedefinovaný. Knihovna použije zvolenou politiku, například nulu nebo upozornení, co je třeba uvést v reporte.

Má se Macro F1 počítat z jednoho prahu?

Při multilabel úlohách výsledek závisí na prahů pro jednotlivé štítky. Prahy se mají volit na validačních datech podle cílových nákladů a ne na testovací sade.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • scikit-learn, F1 score averaging

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.