Generativní a jazyková AI · Zpracování přirozeného jazyka a štruktúrování obsahu

Extrakce informací

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-I-19

Odborná definice

Význam a odborné vymezení pojmu

Information extraction je automatické prevádzání nestruktúrovaného nebo polostruktúrovaného obsahu na explicitní datové prvky a vztahy. Úloha zahrnuje rozpoznávání pomenovaných entít, extrakci atributů, událostí, časových údajů, vztahů a vyplňání schémata z dokumentu. Systém může používat pravidla, sekvenční model, generativní model nebo jejich kombinaci. Výstup musí rozlišovat textový důkaz, normalizovanou hodnotu a nejistotu. Při dlouhých dokumentech je kritické zachovat původ pasáže a vezbu mezi entitami. Extrakce není obyčajné zhrnutie, protože má vytvořit kontrolovatelnou strukturu podle předem určenej ontológie nebo kontraktu.

Srozumitelné vysvětlení

Jak se pojem používá v praxi

Zmluva obsahuje názvy strán, datum účinnosti, cenu, výpovednou lehotu a množství právneho textu. Extrakčný systém má vrátit přesné pole, například dodávatel, 15. august 2026 a 30 dní, spolu s vetou, ze které údaj získal. Nestačí napísat obecný souhrn. Pokud se v dokumente nachádzají tri dátumy, model musí určit jejich rolu a nesmí zaměnit datum podpisu s účinností. Při nejasnosti má označit nízkou istotu nebo poslat položku na kontrolu. Strukturovaný výstup potom lze uložit do databáze, vyhladávat a porovnávat mezi dokumentmi.

Časté otázky

Otázky, které upřesňují význam

Jak se information extraction liší od named entity recognition?

NER označuje výskyty entít, například osoby a organizace. Extrakce informací je širší, protože zahrnuje atributy, vztahy, události, normalizaci a mapování do cílové schémata.

Co je relation extraction?

Určuje významový vztah mezi identifikovanými entitami, například osoba pracuje pro organizaci nebo liek způsobuje nežádoucí účinek. Potřebuje správně hranice entít i kontext vztahu.

Proč je důležitý provenance?

Ku každému polu uchová zdrojový dokument, stranu, rozsah znaků nebo citovanou větu. Umožňuje audit, opravu a ověření, že normalizovaná hodnota nevznikla bez textové opory.

Jak se hodnotí extrakce štruktúrovaného JSON?

Kontroluje se validita schémata, přesnost a recall polí, správnost hodnot, vztahů a důkazových pasáží. Exact match může být příliš prísny při dátumoch nebo názvoch, proto se používá normalizace.

Kdy jsou pravidla lépe než velký jazykový model?

Při stabilním formáte, malém počtu vzorů a potrebe deterministického auditu. Jazykový model lépe zvláda variabilný text, ale vyžaduje schémovou validaci, ověření důkazu a kontrolu halucinací.

Související pojmy

Významové a tematické souvislosti

Zdroje a redakční stopa

Použitá východiska a odborná revize

  • Stanford CS224N, Information Extraction lecture (web.stanford.edu)
  • NIST Text Analysis Conference, Knowledge Base Population (tac.nist.gov)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.