Lokálně učení z příkladů

Algoritmus k nejbližších sousedů

K-nearest neighbors, zkráceně k-NN, je neparametrická metoda, která při predikci vyhladá k tréninkových příkladů nejbližších novému bodu podle zvolené metriky. Při klasifikaci agreguje jejich třídy, při regresii jejich cílové hodnoty, případně s váhami podle vzdálenosti. Model nemá klasickou tréninkovou fázu, uchovává data a rozhoduje lokálně. Výkon závisí na škálování, metriky, hodnoty k, hustoty vzorků a dimenzionality. Při rovnosti hlasů je třeba předem určit deterministické pravidlo, aby pořadí dat nemenilo výsledek.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-K-05

Odborná definice

Odborná definice

K-nearest neighbors, zkráceně k-NN, je neparametrická metoda, která při predikci vyhladá k tréninkových příkladů nejbližších novému bodu podle zvolené metriky. Při klasifikaci agreguje jejich třídy, při regresii jejich cílové hodnoty, případně s váhami podle vzdálenosti. Model nemá klasickou tréninkovou fázu, uchovává data a rozhoduje lokálně. Výkon závisí na škálování, metriky, hodnoty k, hustoty vzorků a dimenzionality. Při rovnosti hlasů je třeba předem určit deterministické pravidlo, aby pořadí dat nemenilo výsledek.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Nový zákazník se podobá na sedem známých zákazníků podle veku, chování a nákupů. K-NN se nepozerá na globálnu rovnici, ale na těchto sousedů. Pokud večšina z nich odišla ku konkurencii, přiřadí vysoké riziko odchodu. Při malém k může rozhodnout šum nebo náhodný soused, při velkém k se lokální skupina rozpustí v priemere celé populace. Pokud příznaky nemají porovnatelnou měřítko, blízkost nebude odrážat skutečnou podobnost. Při produkční změně populace se mění i okolí, ačkoli kód algoritmu zostal zcela stejný.

Časté otázky

Časté otázky

Jako hodnota k mění chování modelu?

Malé k vytváří pružnou hranici a nízké zkreslení, ale vysokou citlivost na šum. Větší k vyhladzuje rozhodování, může však přehlédnout malé lokálně skupiny. Hodnota se volí validací spolu s metrikou a váhami.

Co znamená vážení podle vzdálenosti?

Bližší susedia dostanou větší vliv než vzdialenejší. Při regresii se používá vážený průměr, při klasifikaci vážené hlasování. Je třeba ošetrit nulovou vzdálenost a ověřit, či zvolená funkce váh nezvýrazňuje šum.

Proč k-NN trpí prekliatím dimenzionality?

Ve vysokém počtu rozměrů se vzdálenosti mezi body stávají podobnejšie a lokálně susedstvo ztrácí rozlišovaci schopnost. Pomáhá výběr příznaků, redukce dimenze, učená reprezentace nebo metrika vhodná pro danou doménu.

Musí se při k-NN škálovat každý příznak?

Zpravidla ano, pokud metrika pracuje přímo s číselnými rozdielmi. Bez škálování může atribút s velkým rozsahem prekryť ostatní. Kategorie, text nebo zmiešané data si vyžadují vhodnou reprezentaci a metriku.

Je k-NN vhodný pro velmi velké produkční data?

Predikce může být drahá, protože vyhledává mezi uloženými body. Indexy, aproximované vyhledávání, komprese reprezentací a dávkové zpracování snižují latenci, ale mění přesnost a provozní profil.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • scikit-learn, Nearest Neighbors
  • scikit-learn, KNeighborsClassifier

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.