Neučiteľské učenie a segmentácia

K-means clustering

Zhlukovanie metódou k-priemerov

K-means je centroidový zhlukovací algoritmus, ktorý rozdelí n pozorovaní do k disjunktných skupín minimalizovaním súčtu štvorcov vzdialeností medzi bodmi a centroidom ich priradeného zhluku. Iteruje medzi priradením bodov k najbližšiemu centroidu a prepočtom centroidov ako aritmetických priemerov. Výsledok závisí od škálovania príznakov, inicializácie, zvoleného k a vhodnosti euklidovskej geometrie pre dané dáta. Konvergencia znamená stabilný lokálny výsledok, nie dôkaz globálne najlepšieho rozdelenia.

Posledná odborná revízia
30. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-K-03

Odborná definícia

Odborná definícia

K-means je centroidový zhlukovací algoritmus, ktorý rozdelí n pozorovaní do k disjunktných skupín minimalizovaním súčtu štvorcov vzdialeností medzi bodmi a centroidom ich priradeného zhluku. Iteruje medzi priradením bodov k najbližšiemu centroidu a prepočtom centroidov ako aritmetických priemerov. Výsledok závisí od škálovania príznakov, inicializácie, zvoleného k a vhodnosti euklidovskej geometrie pre dané dáta. Konvergencia znamená stabilný lokálny výsledok, nie dôkaz globálne najlepšieho rozdelenia.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Obchod má zákazníkov opísaných frekvenciou nákupov a priemernou hodnotou košíka. K-means umiestni k pomyselných stredov, každého zákazníka priradí k najbližšiemu a stredy posunie na priemer priradených bodov. Kroky opakuje, kým sa skupiny takmer nemenia. Segmenty nevzniknú podľa obchodných názvov, iba podľa geometrie. Ak jeden príznak meriate v eurách a druhý v jednotkách bez škálovania, eurá môžu rozhodnutie úplne ovládnuť. Po vytvorení skupín ich musí človek overiť na reálnych prípadoch a až potom im priradiť názvy.

Časté otázky

Časté otázky

Ako vybrať počet zhlukov k?

Používa sa doménový cieľ, krivka inertia, silhouette score, stabilita pri opakovaných inicializáciách a využiteľnosť segmentov. Žiadna jediná metrika nezaručuje, že zvolené k má obchodný alebo vedecký význam.

Prečo je k-means citlivý na inicializáciu?

Algoritmus optimalizuje nekonvexnú úlohu a môže skončiť v rôznych lokálnych minimách. Inicializácia k-means++ znižuje riziko zlých štartov, no stále je vhodné spustiť viac behov a porovnať výslednú inertiou aj stabilitu.

Aké tvary zhlukov k-means predpokladá?

Najlepšie funguje pri približne kompaktných, konvexných zhlukoch podobnej mierky v priestore, kde dáva zmysel priemer a euklidovská vzdialenosť. Prstencové, pretiahnuté alebo výrazne rozdielne hustoty môže rozdeliť zavádzajúco.

Ako pracuje s odľahlými bodmi?

Keďže centroid je priemer a cieľ používa štvorce vzdialeností, extrémne body môžu centroid citeľne posunúť. Pomáha robustný preprocessing, orezanie chýb, samostatná detekcia anomálií alebo voľba k-medoids.

Je k-means klasifikačný model?

Nie. Vytvára zhluky bez cieľových štítkov. Zhluky možno neskôr pomenovať alebo použiť ako príznak, ale ich čísla nepredstavujú prirodzené triedy a poradie identifikátorov zhlukov nemá význam.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • scikit-learn, K-means
  • Google ML, K-means overview

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.