Odborná definice
Význam a odborné vymezení pojmu
Information extraction je automatické prevádzání nestruktúrovaného nebo polostruktúrovaného obsahu na explicitní datové prvky a vztahy. Úloha zahrnuje rozpoznávání pomenovaných entít, extrakci atributů, událostí, časových údajů, vztahů a vyplňání schémata z dokumentu. Systém může používat pravidla, sekvenční model, generativní model nebo jejich kombinaci. Výstup musí rozlišovat textový důkaz, normalizovanou hodnotu a nejistotu. Při dlouhých dokumentech je kritické zachovat původ pasáže a vezbu mezi entitami. Extrakce není obyčajné zhrnutie, protože má vytvořit kontrolovatelnou strukturu podle předem určenej ontológie nebo kontraktu.
Srozumitelné vysvětlení
Jak se pojem používá v praxi
Zmluva obsahuje názvy strán, datum účinnosti, cenu, výpovednou lehotu a množství právneho textu. Extrakčný systém má vrátit přesné pole, například dodávatel, 15. august 2026 a 30 dní, spolu s vetou, ze které údaj získal. Nestačí napísat obecný souhrn. Pokud se v dokumente nachádzají tri dátumy, model musí určit jejich rolu a nesmí zaměnit datum podpisu s účinností. Při nejasnosti má označit nízkou istotu nebo poslat položku na kontrolu. Strukturovaný výstup potom lze uložit do databáze, vyhladávat a porovnávat mezi dokumentmi.
Časté otázky
Otázky, které upřesňují význam
Jak se information extraction liší od named entity recognition?
NER označuje výskyty entít, například osoby a organizace. Extrakce informací je širší, protože zahrnuje atributy, vztahy, události, normalizaci a mapování do cílové schémata.
Co je relation extraction?
Určuje významový vztah mezi identifikovanými entitami, například osoba pracuje pro organizaci nebo liek způsobuje nežádoucí účinek. Potřebuje správně hranice entít i kontext vztahu.
Proč je důležitý provenance?
Ku každému polu uchová zdrojový dokument, stranu, rozsah znaků nebo citovanou větu. Umožňuje audit, opravu a ověření, že normalizovaná hodnota nevznikla bez textové opory.
Jak se hodnotí extrakce štruktúrovaného JSON?
Kontroluje se validita schémata, přesnost a recall polí, správnost hodnot, vztahů a důkazových pasáží. Exact match může být příliš prísny při dátumoch nebo názvoch, proto se používá normalizace.
Kdy jsou pravidla lépe než velký jazykový model?
Při stabilním formáte, malém počtu vzorů a potrebe deterministického auditu. Jazykový model lépe zvláda variabilný text, ale vyžaduje schémovou validaci, ověření důkazu a kontrolu halucinací.
Související pojmy
Významové a tematické souvislosti
Zdroje a redakční stopa
Použitá východiska a odborná revize
- Stanford CS224N, Information Extraction lecture (web.stanford.edu)
- NIST Text Analysis Conference, Knowledge Base Population (tac.nist.gov)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
