Odborná definice
Odborná definice
Information extraction je automatické prevádzání nestruktúrovaného nebo polostruktúrovaného obsahu na explicitní datové prvky a vztahy. Úloha zahrnuje rozpoznávání pomenovaných entít, extrakci atributů, událostí, časových údajů, vztahů a vyplňání schémata z dokumentu. Systém může používat pravidla, sekvenční model, generativní model nebo jejich kombinaci. Výstup musí rozlišovat textový důkaz, normalizovanou hodnotu a nejistotu. Při dlouhých dokumentech je kritické zachovat původ pasáže a vezbu mezi entitami. Extrakce není obyčajné zhrnutie, protože má vytvořit kontrolovatelnou strukturu podle předem určenej ontológie nebo kontraktu.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Zmluva obsahuje názvy strán, datum účinnosti, cenu, výpovednou lehotu a množství právneho textu. Extrakčný systém má vrátit přesné pole, například dodávatel, 15. august 2026 a 30 dní, spolu s vetou, ze které údaj získal. Nestačí napísat obecný souhrn. Pokud se v dokumente nachádzají tri dátumy, model musí určit jejich rolu a nesmí zaměnit datum podpisu s účinností. Při nejasnosti má označit nízkou istotu nebo poslat položku na kontrolu. Strukturovaný výstup potom lze uložit do databáze, vyhladávat a porovnávat mezi dokumentmi.
Časté otázky
Časté otázky
Jak se information extraction liší od named entity recognition?
NER označuje výskyty entít, například osoby a organizace. Extrakce informací je širší, protože zahrnuje atributy, vztahy, události, normalizaci a mapování do cílové schémata.
Co je relation extraction?
Určuje významový vztah mezi identifikovanými entitami, například osoba pracuje pro organizaci nebo liek způsobuje nežádoucí účinek. Potřebuje správně hranice entít i kontext vztahu.
Proč je důležitý provenance?
Ku každému polu uchová zdrojový dokument, stranu, rozsah znaků nebo citovanou větu. Umožňuje audit, opravu a ověření, že normalizovaná hodnota nevznikla bez textové opory.
Jak se hodnotí extrakce štruktúrovaného JSON?
Kontroluje se validita schémata, přesnost a recall polí, správnost hodnot, vztahů a důkazových pasáží. Exact match může být příliš prísny při dátumoch nebo názvoch, proto se používá normalizace.
Kdy jsou pravidla lépe než velký jazykový model?
Při stabilním formáte, malém počtu vzorů a potrebe deterministického auditu. Jazykový model lépe zvláda variabilný text, ale vyžaduje schémovou validaci, ověření důkazu a kontrolu halucinací.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Stanford CS224N, Information Extraction lecture (web.stanford.edu)
- NIST Text Analysis Conference, Knowledge Base Population (tac.nist.gov)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
