Nesupervidované učení a segmentace

Clustering

Clustering je skupina nesupervidovaných metod, které rozdělují příklady do shluků podle podobnosti nebo hustoty bez předem daných cílových štítků. Algoritmy jako k-means, hierarchické shlukování, DBSCAN nebo Gaussian mixture používají odlišnou predstavu o tvaru a vzdálenosti skupin. Výsledek není objektívne odhalená pravda, ale struktura závislá od příznaků, škálování, metriky, počtu shluků a parametrů. Kvalita se posuzuje internými metrikami, stabilitou a zejména použitelností v doménové úloze.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-C-14

Odborná definice

Odborná definice

Clustering je skupina nesupervidovaných metod, které rozdělují příklady do shluků podle podobnosti nebo hustoty bez předem daných cílových štítků. Algoritmy jako k-means, hierarchické shlukování, DBSCAN nebo Gaussian mixture používají odlišnou predstavu o tvaru a vzdálenosti skupin. Výsledek není objektívne odhalená pravda, ale struktura závislá od příznaků, škálování, metriky, počtu shluků a parametrů. Kvalita se posuzuje internými metrikami, stabilitou a zejména použitelností v doménové úloze.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

E-shop může zoskupit zákazníků podle frekvence nákupů, kategorií a hodnoty košíka bez toho, aby předem poznal názvy segmentů. Algoritmus najde skupiny, ale člověk až následně zkoumá, či představují lovců zliav, pravidelných kupujúcich nebo pouze rozdílně datové zdroje. Pokud se do výpočtu vloží vek v rokoch a tržby v eurách bez škálování, tržby mohou zcela dominovat vzdálenosti. Shlukování je užitečný nástroj na objavování, ne automatický důkaz prirodzených kategorií lidí.

Časté otázky

Časté otázky

Jak se vybírá počet shluků při k-means?

Používá se elbow curve, silhouette score, gap statistic a doménová interpretace. Žiadna metoda neposkytuje univerzálnu odpověď. Počet musí vést k stabilným a použitelným segmentom, ne pouze k lokálně lepšiemu matematickému skóre.

Proč je škálování příznaků důležité?

Algoritmy založené na vzdálenosti dávají větší vliv premenným s večším numerickým rozsahem. Štandardizace nebo robustní škálování umožní, aby vzdálenost zodpovedala zamýšlanej důležitosti. Kategorické údaje mohou vyžadovat jinou metriku.

Čím se DBSCAN liší od k-means?

DBSCAN hledá husté oblasti, ví označit šum a nepotřebuje předem počet shluků. K-means přiřazuje každý bod k centroidu a preferuje přibližně gulové skupiny. DBSCAN je citlivý na volbu eps a min_samples, zejména při rozdílné hustote.

Jak se ověří stabilita clusteringu?

Shlukování se opakuje při jiném inicializačnom semene, vzorku dat, období a miernej změně parametrů. Potom se porovná přiřazení bodů a význam segmentů. Velmi nestabilní skupiny nejsou vhodným základom pro dlhodobé obchodné pravidlo.

Může clustering vytvořit diskriminačné segmenty?

Ano. I bez citlivého atribútu mohou proxy proměnné oddělit chránené skupiny. Pokud se segmenty používají na ceny, přístup nebo marketing, je třeba analyzovat složení, účel, dopady a možnost námietky. Neutrálne číslo klastra nezaručuje neutralitu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Google Machine Learning Glossary, Clustering

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.