Neučitelské učení a segmentace

Shlukování metodou k-priemerů

K-means je centroidový zhlukovací algoritmus, který rozdělí n pozorování do k disjunktných skupin minimalizováním súčtu štvorců vzdáleností mezi body a centroidom jejich priradeného zhluku. Iteruje mezi priradením bodů k najbližšiemu centroidu a prepočtom centroidů jako aritmetických priemerů. Výsledek závisí na škálování příznaků, inicializace, zvoleného k a vhodnosti euklidovskej geometrie pro dané data. Konvergence znamená stabilní lokální výsledek, ne důkaz globálně najlepšieho rozdělení.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-K-03

Odborná definice

Odborná definice

K-means je centroidový zhlukovací algoritmus, který rozdělí n pozorování do k disjunktných skupin minimalizováním súčtu štvorců vzdáleností mezi body a centroidom jejich priradeného zhluku. Iteruje mezi priradením bodů k najbližšiemu centroidu a prepočtom centroidů jako aritmetických priemerů. Výsledek závisí na škálování příznaků, inicializace, zvoleného k a vhodnosti euklidovskej geometrie pro dané data. Konvergence znamená stabilní lokální výsledek, ne důkaz globálně najlepšieho rozdělení.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Obchod má zákazníků opísaných frekvencí nákupů a priemernou hodnotou košíka. K-means umiestni k pomyselných stredů, každého zákazníka přiřadí k najbližšiemu a stredy posune na průměr priradených bodů. Kroky opakuje, zatímco se skupiny téměř nemění. Segmenty nevzniknou podle obchodných názvů, pouze podle geometrie. Pokud jeden příznak meriate v eurách a druhý v jednotkách bez škálování, eurá mohou rozhodnutí zcela ovládnuť. Po vytvoření skupin jejich musí člověk ověřit na reálných případech a až potom im přiřadit názvy.

Časté otázky

Časté otázky

Jako vybrat počet shluků k?

Používá se doménový cíl, krivka inertia, silhouette score, stabilita při opakovaných inicializacích a využitelnost segmentů. Žiadna jediná metrika nezaručuje, že zvolené k má obchodný nebo vedecký význam.

Proč je k-means citlivý na inicializaci?

Algoritmus optimalizuje nekonvexnou úlohu a může skončit v různých lokálních minimách. Inicializace k-means++ snižuje riziko zlých štartů, ale stále je vhodné spustit více běhů a porovnat výslednou inertiou i stabilitu.

Jaké tvary shluků k-means předpokládá?

Nejlépe funguje při přibližně kompaktných, konvexných zhlukoch podobné měřítka v prostoru, kde dává smysl průměr a euklidovská vzdálenost. Prstencové, pretiahnuté nebo výrazně rozdílně hustoty může rozdelit zavádzajúco.

Jako pracuje s odlahlými body?

Keďže centroid je průměr a cíl používá štvorce vzdáleností, extrémně body mohou centroid citelne posunout. Pomáhá robustní preprocessing, orezání chyb, samostatná detekce anomálií nebo volba k-medoids.

Je k-means klasifikační model?

Ne. Vytváří zhluky bez cílových štítků. Zhluky lze později pomenovat nebo použít jako příznak, ale jejich čísla nepredstavují prirodzené třídy a pořadí identifikátorů shluků nemá význam.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • scikit-learn, K-means
  • Google ML, K-means overview

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.