Samoučenie vizuálnych reprezentácií

I-JEPA

Obrazová architektúra spoločného embeddingového predikovania

I-JEPA, Image-based Joint-Embedding Predictive Architecture, je samoučená architektúra, ktorá z viditeľnej časti obrazu predikuje latentné reprezentácie zakrytých cieľových oblastí, nie ich pixely. Kontextový enkóder vytvorí embedding dostupných blokov, prediktor zohľadní polohu maskovaných regiónov a cieľový enkóder poskytne reprezentáciu, ku ktorej sa predikcia približuje. Výber veľkých cieľových blokov a priestorovo rozptýleného kontextu podporuje učenie sémantických vlastností. Metóda sa vyhýba rekonštrukcii detailov, ktoré nemusia byť dôležité pre rozpoznávanie objektov a scén.

Posledná odborná revízia
29. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-I-01

Odborná definícia

Odborná definícia

I-JEPA, Image-based Joint-Embedding Predictive Architecture, je samoučená architektúra, ktorá z viditeľnej časti obrazu predikuje latentné reprezentácie zakrytých cieľových oblastí, nie ich pixely. Kontextový enkóder vytvorí embedding dostupných blokov, prediktor zohľadní polohu maskovaných regiónov a cieľový enkóder poskytne reprezentáciu, ku ktorej sa predikcia približuje. Výber veľkých cieľových blokov a priestorovo rozptýleného kontextu podporuje učenie sémantických vlastností. Metóda sa vyhýba rekonštrukcii detailov, ktoré nemusia byť dôležité pre rozpoznávanie objektov a scén.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Predstavte si fotografiu bicykla, z ktorej zakryjete koleso a časť rámu. I-JEPA nemá doplniť presnú farbu každého chýbajúceho bodu. Má odhadnúť, akú vnútornú reprezentáciu by zakrytá oblasť mala mať vzhľadom na zvyšok fotografie a svoju polohu. Učí sa tak chápať, že viditeľné riadidlá, sedlo a cesta pravdepodobne patria k bicyklu, aj keď nepozná jeho presný vzhľad. Výsledný enkóder sa potom využije pri klasifikácii, počítaní objektov alebo odhade hĺbky bez potreby ručne označiť každý tréningový obrázok.

Časté otázky

Časté otázky

Čím sa I-JEPA líši od obrazového autoenkódera?

Autoenkóder zvyčajne rekonštruuje vstupné pixely alebo ich distribúciu. I-JEPA porovnáva reprezentácie zakrytých blokov, preto nemusí venovať kapacitu presnej textúre, šumu a detailom, ktoré nie sú potrebné pre sémantickú úlohu.

Prečo sa cieľové bloky vyberajú vo väčšej mierke?

Malý výrez možno často uhádnuť z lokálnej farby alebo okrajov. Väčší región núti model využívať tvar objektu, rozloženie scény a vzdialenejší kontext, čo podporuje abstraktnejšie vizuálne znaky.

Potrebuje I-JEPA dve kópie enkódera?

Architektúra používa kontextový a cieľový enkóder s príbuznými parametrami. Cieľová vetva sa typicky aktualizuje exponenciálnym priemerom kontextovej vetvy a neprechádza cez ňu bežný gradient z predikčnej straty.

Je I-JEPA generatívny obrazový model?

Nie v bežnom zmysle tvorby obrázkov. Predikuje latentný obsah chýbajúcej oblasti, ale nevytvára finálne pixely určené na zobrazenie. Jeho hlavným výstupom je prenositeľná vizuálna reprezentácia.

Ako sa hodnotí kvalita naučenej reprezentácie?

Po predtrénovaní sa enkóder testuje lineárnou klasifikáciou, jemným doladením alebo na ďalších úlohách, napríklad počítaní objektov a odhade hĺbky. Dôležitá je prenositeľnosť, nie iba hodnota predtréningovej straty.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Assran a kol., Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture (arxiv.org) Meta AI, I-JEPA research repository (github.com)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.