Reprezentácia kategorických údajov

One-hot encoding

One-hot kódovanie

One-hot encoding prevádza nominálnu kategorickú premennú s K možnými hodnotami na K binárnych indikátorov, pričom pre jeden záznam je aktívny indikátor príslušnej kategórie a ostatné majú hodnotu nula. Reprezentácia nevnáša umelé poradie medzi kategóriami, ale pri veľkom počte hodnôt vytvára vysokodimenzionálne riedke dáta. Pri lineárnom modeli sa často jedna kategória vynechá alebo sa upraví intercept, aby sa predišlo dokonalej kolinearite. Produkčný encoder musí mať pevný slovník a definované správanie pre neznámu kategóriu.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-O-09

Odborná definícia

Odborná definícia

One-hot encoding prevádza nominálnu kategorickú premennú s K možnými hodnotami na K binárnych indikátorov, pričom pre jeden záznam je aktívny indikátor príslušnej kategórie a ostatné majú hodnotu nula. Reprezentácia nevnáša umelé poradie medzi kategóriami, ale pri veľkom počte hodnôt vytvára vysokodimenzionálne riedke dáta. Pri lineárnom modeli sa často jedna kategória vynechá alebo sa upraví intercept, aby sa predišlo dokonalej kolinearite. Produkčný encoder musí mať pevný slovník a definované správanie pre neznámu kategóriu.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Stĺpec farba s hodnotami červená, zelená a modrá sa zmení na tri prepínače. Červený záznam má jednotku iba v stĺpci červená. Model tak nedostane falošnú informáciu, že modrá je väčšia než zelená, čo by vzniklo pri číslach 1, 2 a 3. Ak však e-shop obsahuje státisíce identifikátorov produktov, takáto reprezentácia spotrebuje veľa pamäte a nezachytí podobnosť medzi položkami. Vtedy sa používajú hashing, target encoding, embeddings alebo natívne kategorické algoritmy podľa rizika úniku a typu modelu.

Časté otázky

Časté otázky

Prečo sa one-hot nepoužíva na prirodzene usporiadané kategórie?

Pri poradí ako nízke, stredné a vysoké môže ordinal encoding zachovať relevantnú štruktúru. One-hot túto informáciu odstráni a model sa musí naučiť každý vzťah samostatne.

Čo sa stane s neznámou kategóriou v produkcii?

Encoder môže vyhodiť chybu, vytvoriť samostatný indikátor unknown alebo všetky známe stĺpce nastaviť na nulu. Voľba musí byť rovnaká pri tréningu aj inferencii a musí sa monitorovať jej frekvencia.

Prečo sa niekedy zahadzuje prvý indikátor?

Pri lineárnom modeli s interceptom je súčet všetkých K indikátorov vždy jedna, čo spôsobuje lineárnu závislosť. Vynechanie referenčnej kategórie odstráni redundanciu, ale mení interpretáciu koeficientov.

Je one-hot vhodný pre stromové modely?

Môže fungovať, no pri vysokej kardinalite vyžaduje veľa stĺpcov a rozdelení. Algoritmus s natívnou podporou kategórií môže byť efektívnejší a zachovať lepšiu štatistickú silu.

Ako sa chráni pred rozdielnym poradím stĺpcov?

Encoder sa uloží ako súčasť pipeline spolu so slovníkom kategórií. Produkcia nesmie nanovo zostaviť stĺpce z aktuálnej dávky, pretože by sa význam pozícií mohol zmeniť.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • scikit-learn, OneHotEncoder

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.