Trénovanie a optimalizácia · Nesupervidované učenie a segmentácia

Zhlukovanie

Clustering

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-C-14

Odborná definícia

Význam a odborné vymedzenie pojmu

Clustering je skupina nesupervidovaných metód, ktoré rozdeľujú príklady do zhlukov podľa podobnosti alebo hustoty bez vopred daných cieľových štítkov. Algoritmy ako k-means, hierarchické zhlukovanie, DBSCAN alebo Gaussian mixture používajú odlišnú predstavu o tvare a vzdialenosti skupín. Výsledok nie je objektívne odhalená pravda, ale štruktúra závislá od príznakov, škálovania, metriky, počtu zhlukov a parametrov. Kvalita sa posudzuje internými metrikami, stabilitou a najmä použiteľnosťou v doménovej úlohe.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

E-shop môže zoskupiť zákazníkov podľa frekvencie nákupov, kategórií a hodnoty košíka bez toho, aby vopred poznal názvy segmentov. Algoritmus nájde skupiny, no človek až následne skúma, či predstavujú lovcov zliav, pravidelných kupujúcich alebo iba rozdielne dátové zdroje. Ak sa do výpočtu vloží vek v rokoch a tržby v eurách bez škálovania, tržby môžu úplne dominovať vzdialenosti. Zhlukovanie je užitočný nástroj na objavovanie, nie automatický dôkaz prirodzených kategórií ľudí.

Časté otázky

Otázky, ktoré spresňujú význam

Ako sa vyberá počet zhlukov pri k-means?

Používa sa elbow curve, silhouette score, gap statistic a doménová interpretácia. Žiadna metóda neposkytuje univerzálnu odpoveď. Počet musí viesť k stabilným a použiteľným segmentom, nie iba k lokálne lepšiemu matematickému skóre.

Prečo je škálovanie príznakov dôležité?

Algoritmy založené na vzdialenosti dávajú väčší vplyv premenným s väčším numerickým rozsahom. Štandardizácia alebo robustné škálovanie umožní, aby vzdialenosť zodpovedala zamýšľanej dôležitosti. Kategorické údaje môžu vyžadovať inú metriku.

Čím sa DBSCAN líši od k-means?

DBSCAN hľadá husté oblasti, vie označiť šum a nepotrebuje vopred počet zhlukov. K-means priraďuje každý bod k centroidu a preferuje približne guľové skupiny. DBSCAN je citlivý na voľbu eps a min_samples, najmä pri rozdielnej hustote.

Ako sa overí stabilita clusteringu?

Zhlukovanie sa opakuje pri inom inicializačnom semene, vzorke dát, období a miernej zmene parametrov. Potom sa porovná priradenie bodov a význam segmentov. Veľmi nestabilné skupiny nie sú vhodným základom pre dlhodobé obchodné pravidlo.

Môže clustering vytvoriť diskriminačné segmenty?

Áno. Aj bez citlivého atribútu môžu proxy premenné oddeliť chránené skupiny. Ak sa segmenty používajú na ceny, prístup alebo marketing, treba analyzovať zloženie, účel, dopady a možnosť námietky. Neutrálne číslo klastra nezaručuje neutralitu.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Google Machine Learning Glossary, Clustering

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.