Pravdepodobnostná klasifikace

Naivný Bayesů klasifikátor

Naive Bayes je rodina klasifikačních algoritmů odvodených z Bayesovej věty, které počítají posteriornou pravděpodobnost třídy při predpoklade podmienenej nezávislosti příznaků po zohladnení třídy. Konkrétní verze volí rozdělení vhodné pro vstupy, například multinomické pro početnosti slov, Bernoulliho pro binární příznaky nebo Gaussovo pro spojité hodnoty. Předpoklad nezávislosti bývá nereálný, ale model může být navzdory tomu přesný, rychlý a stabilní v riedkych vysokodimenzionálnych datech.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-N-02

Odborná definice

Odborná definice

Naive Bayes je rodina klasifikačních algoritmů odvodených z Bayesovej věty, které počítají posteriornou pravděpodobnost třídy při predpoklade podmienenej nezávislosti příznaků po zohladnení třídy. Konkrétní verze volí rozdělení vhodné pro vstupy, například multinomické pro početnosti slov, Bernoulliho pro binární příznaky nebo Gaussovo pro spojité hodnoty. Předpoklad nezávislosti bývá nereálný, ale model může být navzdory tomu přesný, rychlý a stabilní v riedkych vysokodimenzionálnych datech.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Při triedení e-mailů model sleduje, jako často se jednotlivé slova objavují v spame a v legitímnej pošte. Každé slovo vyhodnotí, akoby prinášalo vlastní nezávislý důkaz, a tyto důkazy spojí s tím, jako častá je daná třída. Slova přitom v skutečnosti nezávislé nejsou, ale zjednodušení umožňuje spolehlivý výpočet i při tisícoch příznaků. Naive Bayes je proto silný první model pro text, kategorizaci dokumentů a rychle prototypy, přičemž jeho pravděpodobnosti nemusí být dobře kalibrované.

Časté otázky

Časté otázky

V čem je předpoklad modelu naivný?

Model předpokládá, že po znalosti třídy jeden příznak neposkytuje informaci o jiném príznaku. Při slovech to znamená ignorování slovosledu a vazeb mezi výrazmi, ačkoli právě tyto vezby jsou v přirozeném jazyku běžné.

Který variant je vhodný pro textové dokumenty?

Multinomial Naive Bayes se používá při početnostiach nebo TF-IDF reprezentacích. Bernoulliho variant je vhodný, když příznak vyjadřuje pouze přítomnost nebo neprítomnost termínu.

Proč model používá logaritmy pravděpodobností?

Součin velkého počtu malých pravděpodobností může numericky podtiecť k nule. V logaritmickom prostoru se součin změní na součet, který je stabilnější a jednodušší na porovnávání tříd.

Jsou výstupní pravděpodobnosti Naive Bayes důvěryhodné?

Nemusí být. Silný nezávislostný předpoklad může vést k příliš extrémnym posteriorom. Pokud pravděpodobnost ovlivňuje rozhodovací práh nebo cenu rizika, je třeba ji ověřit kalibračnou krivkou a případně kalibrovat.

Jaké jsou hlavní výhody při malém datasete?

Model odhaduje relativně málo parametrů, trénuje velmi rychle a dokáže využit řídké vstupy bez komplikovanej optimalizace. Výsledek však závisí na vhodného rozdělení a od ošetrení nulových početností.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • scikit-learn, Naive Bayes

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.