Trénovanie a optimalizácia · Príznaky, embeddingy a prenos učenia

Učenie reprezentácií

Representation learning

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-14

Odborná definícia

Význam a odborné vymedzenie pojmu

Representation learning je učenie transformácie, ktorá prevádza surové dáta na interné príznaky alebo embeddingy vhodné pre jednu či viac následných úloh. Reprezentácia môže vzniknúť supervised, self-supervised, unsupervised alebo kontrastívnym tréningom. Dobrá reprezentácia zachytáva relevantné faktory variability, potláča rušivé zmeny a umožňuje jednoduchšiemu downstream modelu využiť informáciu s menším množstvom labelov. Kvalita však závisí od cieľovej úlohy, dátovej distribúcie a toho, ktoré invariancie tréning podporil.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Surový obrázok je pre model veľká mriežka čísel. Representation learning z nej vytvorí priestor, kde sa môžu zoskupiť tvary, objekty alebo významy užitočné pre ďalšie rozhodovanie. Je to podobné voľbe mapy, na ktorej sú dôležité miesta blízko a nepodstatné detaily sa stratia. Tá istá mapa nemusí byť ideálna pre každú úlohu. Reprezentácia vhodná na rozpoznanie predmetu môže potlačiť farbu, ktorá je pritom rozhodujúca pri kontrole kvality výrobku. Reprezentáciu preto treba posudzovať podľa následnej úlohy, nie iba podľa pekného rozloženia bodov.

Časté otázky

Otázky, ktoré spresňujú význam

Ako sa hodnotí kvalita reprezentácie?

Pomocou linear probe, fine-tuningu, retrieval metrík, clusteringu, prenosu medzi datasetmi a testov robustnosti. Jedna vizualizácia embeddingov nestačí.

Čo znamená invariancia reprezentácie?

Zmeny, ktoré nemajú meniť význam, vedú k podobnému internému vektoru. Príkladom je mierne otočenie objektu, ak orientácia nie je pre úlohu relevantná.

Kedy sa encoder zmrazí a kedy fine-tunuje?

Zmrazenie šetrí dáta a výpočet, fine-tuning lepšie prispôsobí reprezentáciu doméne. Pri malom datasete môže úplné odomknutie poškodiť užitočné všeobecné vlastnosti.

Môže reprezentácia obsahovať citlivé informácie?

Áno. Aj keď citlivý atribút nie je explicitný vstup, embedding ho môže kódovať cez korelované znaky. Potrebné sú privacy a fairness testy na konkrétnej úlohe.

Je disentanglement automatickou vlastnosťou embeddingu?

Nie. Oddelené latentné faktory vyžadujú vhodný cieľ, induktívne predpoklady alebo dohľad. Bežný embedding môže miešať viac faktorov v každej dimenzii.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Bengio, Courville and Vincent, Representation Learning: A Review and New Perspectives, 2013

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.