Odborná definice
Odborná definice
K-means je centroidový zhlukovací algoritmus, který rozdělí n pozorování do k disjunktných skupin minimalizováním súčtu štvorců vzdáleností mezi body a centroidom jejich priradeného zhluku. Iteruje mezi priradením bodů k najbližšiemu centroidu a prepočtom centroidů jako aritmetických priemerů. Výsledek závisí na škálování příznaků, inicializace, zvoleného k a vhodnosti euklidovskej geometrie pro dané data. Konvergence znamená stabilní lokální výsledek, ne důkaz globálně najlepšieho rozdělení.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Obchod má zákazníků opísaných frekvencí nákupů a priemernou hodnotou košíka. K-means umiestni k pomyselných stredů, každého zákazníka přiřadí k najbližšiemu a stredy posune na průměr priradených bodů. Kroky opakuje, zatímco se skupiny téměř nemění. Segmenty nevzniknou podle obchodných názvů, pouze podle geometrie. Pokud jeden příznak meriate v eurách a druhý v jednotkách bez škálování, eurá mohou rozhodnutí zcela ovládnuť. Po vytvoření skupin jejich musí člověk ověřit na reálných případech a až potom im přiřadit názvy.
Časté otázky
Časté otázky
Jako vybrat počet shluků k?
Používá se doménový cíl, krivka inertia, silhouette score, stabilita při opakovaných inicializacích a využitelnost segmentů. Žiadna jediná metrika nezaručuje, že zvolené k má obchodný nebo vedecký význam.
Proč je k-means citlivý na inicializaci?
Algoritmus optimalizuje nekonvexnou úlohu a může skončit v různých lokálních minimách. Inicializace k-means++ snižuje riziko zlých štartů, ale stále je vhodné spustit více běhů a porovnat výslednou inertiou i stabilitu.
Jaké tvary shluků k-means předpokládá?
Nejlépe funguje při přibližně kompaktných, konvexných zhlukoch podobné měřítka v prostoru, kde dává smysl průměr a euklidovská vzdálenost. Prstencové, pretiahnuté nebo výrazně rozdílně hustoty může rozdelit zavádzajúco.
Jako pracuje s odlahlými body?
Keďže centroid je průměr a cíl používá štvorce vzdáleností, extrémně body mohou centroid citelne posunout. Pomáhá robustní preprocessing, orezání chyb, samostatná detekce anomálií nebo volba k-medoids.
Je k-means klasifikační model?
Ne. Vytváří zhluky bez cílových štítků. Zhluky lze později pomenovat nebo použít jako příznak, ale jejich čísla nepredstavují prirodzené třídy a pořadí identifikátorů shluků nemá význam.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- scikit-learn, K-means
- Google ML, K-means overview
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
