Odborná definícia
Odborná definícia
K-means je centroidový zhlukovací algoritmus, ktorý rozdelí n pozorovaní do k disjunktných skupín minimalizovaním súčtu štvorcov vzdialeností medzi bodmi a centroidom ich priradeného zhluku. Iteruje medzi priradením bodov k najbližšiemu centroidu a prepočtom centroidov ako aritmetických priemerov. Výsledok závisí od škálovania príznakov, inicializácie, zvoleného k a vhodnosti euklidovskej geometrie pre dané dáta. Konvergencia znamená stabilný lokálny výsledok, nie dôkaz globálne najlepšieho rozdelenia.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Obchod má zákazníkov opísaných frekvenciou nákupov a priemernou hodnotou košíka. K-means umiestni k pomyselných stredov, každého zákazníka priradí k najbližšiemu a stredy posunie na priemer priradených bodov. Kroky opakuje, kým sa skupiny takmer nemenia. Segmenty nevzniknú podľa obchodných názvov, iba podľa geometrie. Ak jeden príznak meriate v eurách a druhý v jednotkách bez škálovania, eurá môžu rozhodnutie úplne ovládnuť. Po vytvorení skupín ich musí človek overiť na reálnych prípadoch a až potom im priradiť názvy.
Časté otázky
Časté otázky
Ako vybrať počet zhlukov k?
Používa sa doménový cieľ, krivka inertia, silhouette score, stabilita pri opakovaných inicializáciách a využiteľnosť segmentov. Žiadna jediná metrika nezaručuje, že zvolené k má obchodný alebo vedecký význam.
Prečo je k-means citlivý na inicializáciu?
Algoritmus optimalizuje nekonvexnú úlohu a môže skončiť v rôznych lokálnych minimách. Inicializácia k-means++ znižuje riziko zlých štartov, no stále je vhodné spustiť viac behov a porovnať výslednú inertiou aj stabilitu.
Aké tvary zhlukov k-means predpokladá?
Najlepšie funguje pri približne kompaktných, konvexných zhlukoch podobnej mierky v priestore, kde dáva zmysel priemer a euklidovská vzdialenosť. Prstencové, pretiahnuté alebo výrazne rozdielne hustoty môže rozdeliť zavádzajúco.
Ako pracuje s odľahlými bodmi?
Keďže centroid je priemer a cieľ používa štvorce vzdialeností, extrémne body môžu centroid citeľne posunúť. Pomáha robustný preprocessing, orezanie chýb, samostatná detekcia anomálií alebo voľba k-medoids.
Je k-means klasifikačný model?
Nie. Vytvára zhluky bez cieľových štítkov. Zhluky možno neskôr pomenovať alebo použiť ako príznak, ale ich čísla nepredstavujú prirodzené triedy a poradie identifikátorov zhlukov nemá význam.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- scikit-learn, K-means
- Google ML, K-means overview
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
