Trénovanie a optimalizácia · Lokálne učenie z príkladov

Algoritmus k najbližších susedov

K-nearest neighbors

Posledná odborná revízia
30. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-K-05

Odborná definícia

Význam a odborné vymedzenie pojmu

K-nearest neighbors, skrátene k-NN, je neparametrická metóda, ktorá pri predikcii vyhľadá k tréningových príkladov najbližších novému bodu podľa zvolenej metriky. Pri klasifikácii agreguje ich triedy, pri regresii ich cieľové hodnoty, prípadne s váhami podľa vzdialenosti. Model nemá klasickú tréningovú fázu, uchováva dáta a rozhoduje lokálne. Výkon závisí od škálovania, metriky, hodnoty k, hustoty vzoriek a dimenzionality. Pri rovnosti hlasov treba vopred určiť deterministické pravidlo, aby poradie dát nemenilo výsledok.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Nový zákazník sa podobá na sedem známych zákazníkov podľa veku, správania a nákupov. K-NN sa nepozerá na globálnu rovnicu, ale na týchto susedov. Ak väčšina z nich odišla ku konkurencii, priradí vysoké riziko odchodu. Pri malom k môže rozhodnúť šum alebo náhodný sused, pri veľkom k sa lokálna skupina rozpustí v priemere celej populácie. Ak príznaky nemajú porovnateľnú mierku, blízkosť nebude odrážať skutočnú podobnosť. Pri produkčnej zmene populácie sa mení aj okolie, hoci kód algoritmu zostal úplne rovnaký.

Časté otázky

Otázky, ktoré spresňujú význam

Ako hodnota k mení správanie modelu?

Malé k vytvára pružnú hranicu a nízke skreslenie, ale vysokú citlivosť na šum. Väčšie k vyhladzuje rozhodovanie, môže však prehliadnuť malé lokálne skupiny. Hodnota sa volí validáciou spolu s metrikou a váhami.

Čo znamená váženie podľa vzdialenosti?

Bližší susedia dostanú väčší vplyv než vzdialenejší. Pri regresii sa používa vážený priemer, pri klasifikácii vážené hlasovanie. Treba ošetriť nulovú vzdialenosť a overiť, či zvolená funkcia váh nezvýrazňuje šum.

Prečo k-NN trpí prekliatím dimenzionality?

Vo vysokom počte rozmerov sa vzdialenosti medzi bodmi stávajú podobnejšie a lokálne susedstvo stráca rozlišovaciu schopnosť. Pomáha výber príznakov, redukcia dimenzie, učená reprezentácia alebo metrika vhodná pre danú doménu.

Musí sa pri k-NN škálovať každý príznak?

Spravidla áno, ak metrika pracuje priamo s číselnými rozdielmi. Bez škálovania môže atribút s veľkým rozsahom prekryť ostatné. Kategórie, text alebo zmiešané dáta si vyžadujú vhodnú reprezentáciu a metriku.

Je k-NN vhodný pre veľmi veľké produkčné dáta?

Predikcia môže byť drahá, pretože vyhľadáva medzi uloženými bodmi. Indexy, aproximované vyhľadávanie, kompresia reprezentácií a dávkové spracovanie znižujú latenciu, no menia presnosť a prevádzkový profil.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • scikit-learn, Nearest Neighbors
  • scikit-learn, KNeighborsClassifier

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.