Odborná definícia
Význam a odborné vymedzenie pojmu
Representation learning je učenie transformácie, ktorá prevádza surové dáta na interné príznaky alebo embeddingy vhodné pre jednu či viac následných úloh. Reprezentácia môže vzniknúť supervised, self-supervised, unsupervised alebo kontrastívnym tréningom. Dobrá reprezentácia zachytáva relevantné faktory variability, potláča rušivé zmeny a umožňuje jednoduchšiemu downstream modelu využiť informáciu s menším množstvom labelov. Kvalita však závisí od cieľovej úlohy, dátovej distribúcie a toho, ktoré invariancie tréning podporil.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Surový obrázok je pre model veľká mriežka čísel. Representation learning z nej vytvorí priestor, kde sa môžu zoskupiť tvary, objekty alebo významy užitočné pre ďalšie rozhodovanie. Je to podobné voľbe mapy, na ktorej sú dôležité miesta blízko a nepodstatné detaily sa stratia. Tá istá mapa nemusí byť ideálna pre každú úlohu. Reprezentácia vhodná na rozpoznanie predmetu môže potlačiť farbu, ktorá je pritom rozhodujúca pri kontrole kvality výrobku. Reprezentáciu preto treba posudzovať podľa následnej úlohy, nie iba podľa pekného rozloženia bodov.
Časté otázky
Otázky, ktoré spresňujú význam
Ako sa hodnotí kvalita reprezentácie?
Pomocou linear probe, fine-tuningu, retrieval metrík, clusteringu, prenosu medzi datasetmi a testov robustnosti. Jedna vizualizácia embeddingov nestačí.
Čo znamená invariancia reprezentácie?
Zmeny, ktoré nemajú meniť význam, vedú k podobnému internému vektoru. Príkladom je mierne otočenie objektu, ak orientácia nie je pre úlohu relevantná.
Kedy sa encoder zmrazí a kedy fine-tunuje?
Zmrazenie šetrí dáta a výpočet, fine-tuning lepšie prispôsobí reprezentáciu doméne. Pri malom datasete môže úplné odomknutie poškodiť užitočné všeobecné vlastnosti.
Môže reprezentácia obsahovať citlivé informácie?
Áno. Aj keď citlivý atribút nie je explicitný vstup, embedding ho môže kódovať cez korelované znaky. Potrebné sú privacy a fairness testy na konkrétnej úlohe.
Je disentanglement automatickou vlastnosťou embeddingu?
Nie. Oddelené latentné faktory vyžadujú vhodný cieľ, induktívne predpoklady alebo dohľad. Bežný embedding môže miešať viac faktorov v každej dimenzii.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Bengio, Courville and Vincent, Representation Learning: A Review and New Perspectives, 2013
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
