Odborná definice
Odborná definice
K-nearest neighbors, zkráceně k-NN, je neparametrická metoda, která při predikci vyhladá k tréninkových příkladů nejbližších novému bodu podle zvolené metriky. Při klasifikaci agreguje jejich třídy, při regresii jejich cílové hodnoty, případně s váhami podle vzdálenosti. Model nemá klasickou tréninkovou fázu, uchovává data a rozhoduje lokálně. Výkon závisí na škálování, metriky, hodnoty k, hustoty vzorků a dimenzionality. Při rovnosti hlasů je třeba předem určit deterministické pravidlo, aby pořadí dat nemenilo výsledek.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Nový zákazník se podobá na sedem známých zákazníků podle veku, chování a nákupů. K-NN se nepozerá na globálnu rovnici, ale na těchto sousedů. Pokud večšina z nich odišla ku konkurencii, přiřadí vysoké riziko odchodu. Při malém k může rozhodnout šum nebo náhodný soused, při velkém k se lokální skupina rozpustí v priemere celé populace. Pokud příznaky nemají porovnatelnou měřítko, blízkost nebude odrážat skutečnou podobnost. Při produkční změně populace se mění i okolí, ačkoli kód algoritmu zostal zcela stejný.
Časté otázky
Časté otázky
Jako hodnota k mění chování modelu?
Malé k vytváří pružnou hranici a nízké zkreslení, ale vysokou citlivost na šum. Větší k vyhladzuje rozhodování, může však přehlédnout malé lokálně skupiny. Hodnota se volí validací spolu s metrikou a váhami.
Co znamená vážení podle vzdálenosti?
Bližší susedia dostanou větší vliv než vzdialenejší. Při regresii se používá vážený průměr, při klasifikaci vážené hlasování. Je třeba ošetrit nulovou vzdálenost a ověřit, či zvolená funkce váh nezvýrazňuje šum.
Proč k-NN trpí prekliatím dimenzionality?
Ve vysokém počtu rozměrů se vzdálenosti mezi body stávají podobnejšie a lokálně susedstvo ztrácí rozlišovaci schopnost. Pomáhá výběr příznaků, redukce dimenze, učená reprezentace nebo metrika vhodná pro danou doménu.
Musí se při k-NN škálovat každý příznak?
Zpravidla ano, pokud metrika pracuje přímo s číselnými rozdielmi. Bez škálování může atribút s velkým rozsahem prekryť ostatní. Kategorie, text nebo zmiešané data si vyžadují vhodnou reprezentaci a metriku.
Je k-NN vhodný pro velmi velké produkční data?
Predikce může být drahá, protože vyhledává mezi uloženými body. Indexy, aproximované vyhledávání, komprese reprezentací a dávkové zpracování snižují latenci, ale mění přesnost a provozní profil.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- scikit-learn, Nearest Neighbors
- scikit-learn, KNeighborsClassifier
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
