Odborná definícia
Odborná definícia
High-dimensional data sú dáta s veľkým počtom príznakov vzhľadom na počet pozorovaní, dostupný výpočet alebo efektívne množstvo informácie. Vo vysokom rozmere rastie priestor exponenciálne, body bývajú riedke a rozdiel medzi najbližšou a vzdialenou položkou sa môže zmenšovať. Odhad parametrov preto vyžaduje viac dát a metriky podobnosti môžu stratiť rozlišovaciu schopnosť, čo sú prejavy curse of dimensionality. Nie každý veľký vektor je však rovnako problematický, pretože dáta môžu ležať na nízkorozmernej štruktúre. Pomáha regularizácia, výber príznakov, redukcia rozmernosti a doménová metrika.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
V dvojrozmernej mape možno body pokryť relatívne malým počtom buniek. Ak však pridáte stovky nezávislých osí, rovnaká hustota by vyžadovala astronomické množstvo pozorovaní. Väčšina priestoru zostane prázdna a nový bod môže byť ďaleko od všetkých tréningových dát. Zároveň môže mať každý objekt tisíce meraní, ale iba niekoľko skutočných faktorov, napríklad tému, štýl a čas. Úlohou modelu je nájsť túto užitočnú štruktúru a ignorovať šum. Samotný počet stĺpcov teda nehovorí, či problém zvládnete, rozhoduje aj redundancia, sparsity a počet vzoriek.
Časté otázky
Časté otázky
Kedy je dataset vysokorozmerný?
Neexistuje univerzálna hranica. Dôležitý je pomer rozmerov k vzorkám, typ modelu, sparsity a množstvo nezávislej informácie. Tisíc príznakov môže byť zvládnuteľných pri miliónoch dát, ale kritických pri stovke pacientov.
Čo je curse of dimensionality?
Je to súbor javov, pri ktorých s rastom rozmeru prudko rastie potrebné pokrytie priestoru, vzdialenosti sa koncentrujú a lokálne odhady strácajú oporu. Dôsledok závisí od distribúcie a vnútornej dimenzie dát.
Prečo môže k-nearest neighbors zlyhať?
Ak sú všetky body v použitom rozmere podobne ďaleko, najbližší sused nie je výrazne informatívnejší než ostatní. Nevhodné škálovanie a množstvo irelevantných príznakov tento efekt ešte zosilnia.
Ako pomáha redukcia rozmernosti?
PCA, autoenkóder alebo náhodná projekcia vytvoria menšiu reprezentáciu, ktorá zachováva vybranú štruktúru. Redukcia môže odstrániť šum a zrýchliť model, ale môže stratiť zriedkavý signál dôležitý pre cieľ.
Je embedding automaticky riešením vysokého rozmeru?
Nie. Embedding môže zhustiť pôvodné dáta, ale jeho rozmery a geometria sú naučené podľa tréningového cieľa. Ak cieľ nezodpovedá novej úlohe, menší vektor môže odstrániť práve potrebnú informáciu.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Bellman, Dynamic Programming (press.princeton.edu)
- scikit-learn, Random Projection (scikit-learn.org)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
