Příznaky, embeddingy a přenos učení

Učení reprezentací

Representation learning je učení transformace, která převádí surová data na interní příznaky nebo embeddingy vhodné pro jednu či více následných úloh. Reprezentace může vzniknout supervised, self-supervised, unsupervised nebo kontrastívnym tréninkem. Dobrá reprezentace zachycuje relevantní faktory variability, potláča rušivé změny a umožňuje jednoduchšiemu downstream modelu využit informaci s menším množstvím labelů. Kvalita však závisí na cílové úlohy, datové distribuce a toho, které invariance trénink podporil.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-14

Odborná definice

Odborná definice

Representation learning je učení transformace, která převádí surová data na interní příznaky nebo embeddingy vhodné pro jednu či více následných úloh. Reprezentace může vzniknout supervised, self-supervised, unsupervised nebo kontrastívnym tréninkem. Dobrá reprezentace zachycuje relevantní faktory variability, potláča rušivé změny a umožňuje jednoduchšiemu downstream modelu využit informaci s menším množstvím labelů. Kvalita však závisí na cílové úlohy, datové distribuce a toho, které invariance trénink podporil.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Surový obrázek je pro model velká mriežka čísel. Representation learning z ní vytvoří prostor, kde se mohou zoskupit tvary, objekty nebo významy užitečné pro další rozhodování. Je to podobné volbe mapy, na které jsou důležité místa blízko a nepodstatné detaily se stratia. Tá jistá mapa nemusí být ideálna pro každou úlohu. Reprezentace vhodná na rozpoznání predmetu může potlačit farbu, která je přitom rozhodujúca při kontrole kvality výrobku. Reprezentaci proto je třeba posuzovat podle následnej úlohy, ne pouze podle pekného rozložení bodů.

Časté otázky

Časté otázky

Jak se hodnotí kvalita reprezentace?

Pomocí linear probe, fine-tuningu, retrieval metrik, clusteringu, přenosu mezi datasety a testů robustnosti. Jedna vizualizace embeddingů nestačí.

Co znamená invariance reprezentace?

Změny, které nemají měnit význam, vedou k podobnému internému vektoru. Příkladem je mírně otočení objektu, pokud orientace není pro úlohu relevantná.

Kdy se encoder zmrazí a kdy fine-tunuje?

Zmrazení šetří data a výpočet, fine-tuning lépe prispůsobí reprezentaci doméně. Při malém datasete může úplné odomknutie poškodit užitečné obecné vlastnosti.

Může reprezentace obsahovat citlivé informace?

Ano. I když citlivý atribút není explicitní vstup, embedding ho může kódovat přes korelované znaky. Potřebné jsou privacy a fairness testy na konkrétní úloze.

Je disentanglement automatickou vlastností embeddingu?

Ne. Oddělené latentní faktory vyžadují vhodný cíl, induktivní předpoklady nebo dohled. Běžný embedding může miešat více faktorů v každé dimenzii.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Bengio, Courville and Vincent, Representation Learning: A Review and New Perspectives, 2013

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.