Generativní a percepčné systémy

Multimodální umělá inteligence

Multimodal AI označuje systémy, které prijímají, spojují, interpretují nebo generují více typů údajů, například text, obraz, zvuk, video, senzorické signály nebo prostorové data. Modalita může mít samostatný encoder a následnou fúziu, nebo se údaje prevedou do společné tokenovej či embeddingovej reprezentace. Systém může provádět cross-modal retrieval, vizuálně odpovídání, titulkování, překlad řeči nebo generování obrazu z textu. Kvalita závisí na zarovnání modalit, časovej synchronizace a pokrytí dat.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-M-25

Odborná definice

Odborná definice

Multimodal AI označuje systémy, které prijímají, spojují, interpretují nebo generují více typů údajů, například text, obraz, zvuk, video, senzorické signály nebo prostorové data. Modalita může mít samostatný encoder a následnou fúziu, nebo se údaje prevedou do společné tokenovej či embeddingovej reprezentace. Systém může provádět cross-modal retrieval, vizuálně odpovídání, titulkování, překlad řeči nebo generování obrazu z textu. Kvalita závisí na zarovnání modalit, časovej synchronizace a pokrytí dat.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Člověk při rozhodování kombinuje to, co čte, vidí a počuje. Multimodální AI systém se snaží pracovat s podobně různorodými vstupmi. Může dostat fotografii zařízení a textovou otázku, najít relevantní část obrazu a vytvořit odpověď. Jiný model spojí zvuk s videom nebo vyhladá obrázek podle věty. Jedna modalita může doplnit chybějící kontext, ale může i zavádzat. Pokud titulok neodpovídá obrázku nebo zvuk není synchronizovaný, model se může naučit falešné spojení.

Časté otázky

Časté otázky

Co je multimodální fúze?

Způsob kombinování informace z modalit. Early fusion spojuje reprezentace dříve, late fusion kombinuje samostatné rozhodnutí a hybridní řešení používají více úrovní.

Je model text-to-image multimodální?

Ano, pracuje se vstupnou textovou modalitou a generuje obrazovou modalitu. Multimodálnost nevyžaduje, aby všechny modality byly současně na vstupe.

Jak se modalitám vytvoří společný prostor?

Kontrastívnym učením na pároch, například obraz a jeho titulok, nebo spoločným transformerom, který optimalizuje úlohy vyžadujúce interakci mezi tokenmi.

Co se stane, pokud jedna modalita chybí?

Architektura musí mít definovanou strategii, například maskování, náhradný vstup nebo unimodálny fallback. Jinak může výkon nepredvídatelne klesnout.

Jaké rizika jsou specifické pro multimodální systémy?

Nesprávně zarovnání, útok v jedné modalite ovplyvňujúci jinou, skryté citlivé údaje v obraze nebo zvuku a falešná důvěra, když se modality navzájem zdanlivo potvrdzují.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • NIST AI 600-1, Generative AI Profile

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.