Zpracování přirozeného jazyka

Extrakce entít

Entity extraction je proces prevodu neštruktúrovaného textu na strukturované záznamy o objektoch, které jsou relevantní pro danou úlohu. Může zahrnovat nájdení zmienok, určení typu entity, normalizaci hodnoty, získání atributů a vztahů nebo přiřazení identifikátora. Je širší než klasické named entity recognition, protože doménová entita nemusí být vlastní jméno a výstup může obsahovat například číslo smlouvy, výrobok, dávku, diagnózu, datum účinnosti a vezbu mezi nimi. Schéma určuje, které objekty a vezby se mají vyhladat.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-E-13

Odborná definice

Odborná definice

Entity extraction je proces prevodu neštruktúrovaného textu na strukturované záznamy o objektoch, které jsou relevantní pro danou úlohu. Může zahrnovat nájdení zmienok, určení typu entity, normalizaci hodnoty, získání atributů a vztahů nebo přiřazení identifikátora. Je širší než klasické named entity recognition, protože doménová entita nemusí být vlastní jméno a výstup může obsahovat například číslo smlouvy, výrobok, dávku, diagnózu, datum účinnosti a vezbu mezi nimi. Schéma určuje, které objekty a vezby se mají vyhladat.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Z reklamace nestačí označit název výrobku. Firma může potrebovat tabulku s modelem, sériovým číslem, typem chyby, datem nákupu a požadovaným řešením. Entity extraction skládá tyto údaje z věty do polí, které může zpracovat workflow. Část se dá řešit pravidly, část modelem nebo LLM se schématem výstupu. Najťažšie není najít slovo, ale správně spojit hodnotu s entitou, normalizovat formát a priznat nejistotu, když text neposkytuje dostatek informací. Výstup musí zachovat i vezbu na původní textovou pasáž.

Časté otázky

Časté otázky

Jak se entity extraction liší od NER?

NER označuje textové úseky a jejich typy. Extrakce může navíc vyplnit atributy, normalizovat hodnoty, odvodit vztahy a vytvořit cílový záznam.

Může se extrakce realizovat bez strojového učení?

Ano. Při stabilných formátoch fungují regulárne výrazy, slovníky a pravidla. Model je užitečný při variabilnom jazyku a nejednoznačnom kontextu.

Jak se hodnotí extrakce více polí?

Kromě precision, recall a F1 po polích se sleduje úplnost celého záznamu, správnost vazeb, normalizace a podíl případů odovzdaných člověku.

Co je schema-constrained extraction?

Model musí vrátit výstup podle předem definovanej schémata, například JSON s povolenými typmi. Schéma zlepší formát, ne nevyhnutelně faktickou správnost.

Jak se řeší chýbajúca hodnota?

Systém ji nemá domýšlat. Má použít null, stav neznámé nebo explicitní nejistotu a podle významu požiadat o doplnění či manuálne ověření.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.