Odborná definícia
Odborná definícia
Information extraction je automatické prevádzanie nestruktúrovaného alebo polostruktúrovaného obsahu na explicitné dátové prvky a vzťahy. Úloha zahŕňa rozpoznávanie pomenovaných entít, extrakciu atribútov, udalostí, časových údajov, vzťahov a vypĺňanie schémy z dokumentu. Systém môže používať pravidlá, sekvenčný model, generatívny model alebo ich kombináciu. Výstup musí rozlišovať textový dôkaz, normalizovanú hodnotu a neistotu. Pri dlhých dokumentoch je kritické zachovať pôvod pasáže a väzbu medzi entitami. Extrakcia nie je obyčajné zhrnutie, pretože má vytvoriť kontrolovateľnú štruktúru podľa vopred určenej ontológie alebo kontraktu.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Zmluva obsahuje názvy strán, dátum účinnosti, cenu, výpovednú lehotu a množstvo právneho textu. Extrakčný systém má vrátiť presné polia, napríklad dodávateľ, 15. august 2026 a 30 dní, spolu s vetou, z ktorej údaj získal. Nestačí napísať všeobecný súhrn. Ak sa v dokumente nachádzajú tri dátumy, model musí určiť ich rolu a nesmie zameniť dátum podpisu s účinnosťou. Pri nejasnosti má označiť nízku istotu alebo poslať položku na kontrolu. Štruktúrovaný výstup potom možno uložiť do databázy, vyhľadávať a porovnávať medzi dokumentmi.
Časté otázky
Časté otázky
Ako sa information extraction líši od named entity recognition?
NER označuje výskyty entít, napríklad osoby a organizácie. Extrakcia informácií je širšia, pretože zahŕňa atribúty, vzťahy, udalosti, normalizáciu a mapovanie do cieľovej schémy.
Čo je relation extraction?
Určuje významový vzťah medzi identifikovanými entitami, napríklad osoba pracuje pre organizáciu alebo liek spôsobuje nežiaduci účinok. Potrebuje správne hranice entít aj kontext vzťahu.
Prečo je dôležitý provenance?
Ku každému poľu uchová zdrojový dokument, stranu, rozsah znakov alebo citovanú vetu. Umožňuje audit, opravu a overenie, že normalizovaná hodnota nevznikla bez textovej opory.
Ako sa hodnotí extrakcia štruktúrovaného JSON?
Kontroluje sa validita schémy, presnosť a recall polí, správnosť hodnôt, vzťahov a dôkazových pasáží. Exact match môže byť príliš prísny pri dátumoch alebo názvoch, preto sa používa normalizácia.
Kedy sú pravidlá lepšie než veľký jazykový model?
Pri stabilnom formáte, malom počte vzorov a potrebe deterministického auditu. Jazykový model lepšie zvláda variabilný text, ale vyžaduje schémovú validáciu, overenie dôkazu a kontrolu halucinácií.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Stanford CS224N, Information Extraction lecture (web.stanford.edu)
- NIST Text Analysis Conference, Knowledge Base Population (tac.nist.gov)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
