Odborná definícia
Význam a odborné vymedzenie pojmu
Hierarchical clustering je metóda zhlukovania, ktorá vytvára vnorenú postupnosť skupín reprezentovanú dendrogramom. Aglomeratívny variant začína jednotlivými bodmi a opakovane spája najbližšie zhluky, divizívny začína celou množinou a postupne ju rozdeľuje. Výsledok závisí od metriky vzdialenosti a linkage pravidla, napríklad single, complete, average alebo Ward. Počet zhlukov sa nemusí zadať pred tréningom, vyberie sa rezom stromu. Hierarchia však nie je automaticky objektívna taxonómia a skoré chybné spojenie sa v bežnom aglomeratívnom postupe už neopraví.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Predstavte si, že triedite dokumenty najprv do veľmi úzkych skupín podľa podobných formulácií, potom tieto skupiny spájate do širších tém a napokon do niekoľkých hlavných oblastí. Dendrogram ukáže každú úroveň spájania. Ak strom prerežete nízko, dostanete mnoho detailných zhlukov, vyšší rez vytvorí menej všeobecných kategórií. Výsledok sa však môže dramaticky zmeniť podľa toho, či za vzdialenosť dvoch skupín považujete najbližšiu, najvzdialenejšiu alebo priemernú dvojicu. Strom preto vizualizuje rozhodnutia algoritmu, nie jedinú prirodzenú štruktúru sveta.
Časté otázky
Otázky, ktoré spresňujú význam
Čo znamená linkage pri hierarchickom zhlukovaní?
Je to pravidlo na výpočet vzdialenosti medzi dvoma zhlukmi. Single linkage používa najbližšiu dvojicu, complete najvzdialenejšiu, average priemer a Ward minimalizuje nárast vnútrozhlukovej variability.
Ako sa určí počet zhlukov?
Dendrogram sa prereže pri zvolenej výške alebo sa použije kritérium vzdialenosti, stability či doménovej interpretovateľnosti. Silueta môže pomôcť, ale sama neurčuje, ktorá úroveň je obchodne alebo vedecky správna.
Prečo single linkage vytvára reťazce?
Stačí, aby každý nový bod bol blízko aspoň jednému členu zhluku. Postupne môže spojiť dlhý pás bodov, hoci jeho vzdialené konce si nie sú podobné, čo sa označuje ako chaining effect.
Je hierarchické zhlukovanie vhodné pre veľké datasety?
Klasické algoritmy často potrebujú kvadratickú pamäť alebo čas na maticu vzdialeností. Pri veľkých dátach sa používa vzorkovanie, aproximácia, obmedzenie susedstva alebo najprv redukcia počtu reprezentantov.
Ako citlivé je na škálovanie príznakov?
Veľmi, ak metrika používa numerické vzdialenosti. Príznak s veľkým rozsahom môže dominovať stromu, preto sa škáluje podľa významu, robustne normalizuje alebo nahrádza vhodnou doménovou metrikou.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- scikit-learn, Hierarchical clustering (scikit-learn.org)
- SciPy, hierarchical clustering (docs.scipy.org)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
