Odborná definice
Odborná definice
Kernel density estimation, KDE, je neparametrický odhad pravdepodobnostnej hustoty, který umiestni na každý pozorovaný bod hladkou jadrovou funkci a jejich příspěvky spriemeruje. Klíčový parameter bandwidth určuje míru vyhladení, zatímco typ kernelu ovlivňuje lokální tvar. KDE nepredpokladá konkrétní rodinu rozdělení, ale ve vyšších dimenziách potřebuje mnoho dat a výsledek je citlivý na škálování, hranice podpory a volbu metriky. Při multivariátnych datech může mít bandwidth jednu měřítko nebo samostatnou matici pro různé směry.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Máte časy, kdy uživatelé otvárají aplikaci, a chcete vidět typické špičky bez vnucování normálneho rozdělení. Nad každý čas položíte malý hladký kopček. Součet kopčeků vytvoří krivku hustoty. Úzký bandwidth ukáže mnoho drobných vrcholů, včetně náhodného šumu. Široký bandwidth spojí rannou a večernou špičku do jednoho nepresného kopca. Při údajoch obmedzených například na kladné hodnoty je třeba řešit, aby hustota uměle neunikala za hranici. Krivka je odhad z konkrétní vzorku, ne důkaz, že populace má přesně stejný počet vrcholů.
Časté otázky
Časté otázky
Co je bandwidth?
Měřítko šířky jadier, která řídí kompromis mezi variancí a zkreslením. Malá hodnota kopíruje jednotlivé pozorování, velká hodnota silně vyhladzuje. Volí se pravidlem, cross-validací nebo doménovým posúdením.
Musí se hustota integrovat na jedna?
Ano, korektný odhad hustoty má po celé oblasti integrál jedna. Implementace to zabezpečuje normalizací jadier, ale při neštandardnej metrice nebo hranicích je třeba ověřit interpretaci výsledných log-hustůt.
Jako KDE pomáhá při detekci anomálií?
Body v oblastiach s velmi nízkou odhadovanou hustotou lze označit jako neobvyklé. Práh se však kalibruje na validačních datech, protože řídká legitímna podskupina může vyzerat stejně jako chyba.
Proč KDE selhává ve vysokých dimenziách?
Objem prostoru roste a lokálně okolí zůstává řídké, takže hladký odhad potřebuje exponenciálne více dat. Pomáhá redukce dimenze, faktorové modely nebo hustota v naučenom latentním prostoru.
Jaký kernel se používá nejčastěji?
Gaussovský kernel je běžný pro hladkosť a jednoduchou interpretaci. Při dostatku dat má často větší vliv bandwidth než přesný tvar kernelu, ale kompaktná podpora nebo doménové hranice mohou volbu změnit.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- scikit-learn, KernelDensity
- scikit-learn, Density Estimation
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
