Datové architektury a obsah

nestrukturovaná data

Unstructured data jsou informace, které nemají pevnou tabulkovou schéma s jednotnými stlpcami pro každý záznam. Patří sem dokumenty, e-maily, volný text, obrázky, audio, video, prezentace nebo kombinované soubory. Označení neznamená absenci struktury, protože formát, metadata, sekcie a časové stopy mohou být bohaté, ale nejsou vyjadrené jednou relačnou schématem. AI pipeline musí obsah extrahovat, segmentovat, normalizovat, zabezpečit a prepojit s původom před modelováním nebo retrievalem. Pipeline má uchovat hash originálu a mapování extrahovaných bloků na stránky nebo časové úseky zdrojového souboru.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-U-18

Odborná definice

Odborná definice

Unstructured data jsou informace, které nemají pevnou tabulkovou schéma s jednotnými stlpcami pro každý záznam. Patří sem dokumenty, e-maily, volný text, obrázky, audio, video, prezentace nebo kombinované soubory. Označení neznamená absenci struktury, protože formát, metadata, sekcie a časové stopy mohou být bohaté, ale nejsou vyjadrené jednou relačnou schématem. AI pipeline musí obsah extrahovat, segmentovat, normalizovat, zabezpečit a prepojit s původom před modelováním nebo retrievalem. Pipeline má uchovat hash originálu a mapování extrahovaných bloků na stránky nebo časové úseky zdrojového souboru.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Faktúra ve formáte PDF má vizuálně pole, text, tabulku i logo, ale databáze z ní neví přímo prečítat stejné sloupce jako z účtovnej tabulky. Nejprve je třeba získat text a rozložení, rozpoznat typ dokumentu, najít hodnoty a zachovat vezbu na originál. Podobně při videu existuje obrazová, zvuková a časová struktura. Pojem nestrukturovaná tedy popisuje absenci jednotnej datové schémata, ne chaos bez formy. Príprava bývá drahšia než samotné volání modelu. Bez provenance nelze spolehlivě citovat odpověď, opravit chybnou extrakci ani uplatnit rozdílně přístupová práva.

Časté otázky

Časté otázky

Je JSON unstructured data?

JSON je syntakticky strukturovaný, ale jeho obsah může mít premenlivou nebo vnorenou schéma. Klasifikace závisí na konzistentnosti a způsobu použití, ne pouze od prípony souboru.

Jak se nestrukturovaná data pripravují pro RAG?

Dokumenty se parsují, čistia, dělí na významové bloky, doplňají metadátami, embedují a indexují. Každý chunk musí zachovat zdroj a přístupové oprávnění.

Jaké rizika vznikají při extrakcii PDF?

Může se stratit pořadí stlpců, hlavičky, poznámky, tabulky nebo text v obrázcích. Kritické dokumenty potřebují vizuálnu kontrolu nebo layout-aware parser.

Proč jsou metadata důležité?

Datum, autor, typ, jazyk, verze a oprávnění umožňují filtrování, časovou platnost, audit a zabránení zobrazení obsahu nesprávnemu uživateli.

Je možné unstructured data uložit do databáze?

Ano. Databáze může uchovat soubor, extrahovaný text, embeddingy a metadata. Uložení však samo nevytvorí konzistentnou sémantickou schéma.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • NIST Big Data Interoperability Framework, Reference Architecture Apache Tika documentation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.