Spracovanie prirodzeného jazyka

Entity recognition

Rozpoznávanie entít

Entity recognition, často named entity recognition alebo NER, je úloha identifikovať v texte súvislé úseky, ktoré označujú entity, a priradiť im kategóriu, napríklad osobu, organizáciu, lokalitu, produkt alebo dátum. Model rozhoduje o hraniciach zmienky aj jej type. Tradičné NER zvyčajne vytvára neprekrývajúce sa span-y a neurčuje, ku ktorému konkrétnemu záznamu entita patrí. Výkon závisí od anotovanej schémy, tokenizácie, domény, jazyka a pravidiel pre vnorené či nejednoznačné entity.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-E-15

Odborná definícia

Odborná definícia

Entity recognition, často named entity recognition alebo NER, je úloha identifikovať v texte súvislé úseky, ktoré označujú entity, a priradiť im kategóriu, napríklad osobu, organizáciu, lokalitu, produkt alebo dátum. Model rozhoduje o hraniciach zmienky aj jej type. Tradičné NER zvyčajne vytvára neprekrývajúce sa span-y a neurčuje, ku ktorému konkrétnemu záznamu entita patrí. Výkon závisí od anotovanej schémy, tokenizácie, domény, jazyka a pravidiel pre vnorené či nejednoznačné entity.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Vo vete Tesla otvorila závod pri Berlíne môže NER označiť Tesla ako organizáciu a Berlín ako lokalitu. Ešte však nevie, ktorý firemný záznam alebo ktoré administratívne územie tým text myslí. Rozpoznávanie entít je preto zvýrazňovač s typmi, nie úplné porozumenie sveta. V medicíne alebo výrobe sa používajú vlastné kategórie a hranice. Výraz typ 2 môže patriť k diagnóze, ale samostatne nedáva zmysel, takže kvalita anotácie hraníc je rovnako dôležitá ako správny štítok. Doménové pravidlá určujú, čo sa ráta ako jedna entita.

Časté otázky

Časté otázky

Čo model pri NER predikuje?

Pre každý token alebo span určuje, či patrí do entity, kde entita začína a končí a aký typ jej prislúcha podľa anotovanej schémy.

Prečo sa používajú schémy BIO alebo BILUO?

Kódujú hranice entít na úrovni tokenov. Rozlišujú začiatok, vnútro, koniec, samostatnú jednotku a token mimo entity.

Vie klasické NER zachytiť vnorené entity?

Nie každý model. Prekrývajúce sa span-y vyžadujú inú reprezentáciu alebo samostatný span classifier, pretože jednoduché sekvenčné značkovanie povoľuje jednu značku na token.

Ako sa hodnotia hranice entity?

Najčastejšie exact span precision, recall a F1. Čiastočne prekrytá zmienka sa pri prísnom hodnotení počíta ako chyba, hoci typ môže byť správny.

Kedy pomôže kombinácia pravidiel a modelu?

Pri stabilných názvoch, kódoch a registroch môžu pravidlá doplniť štatistický model. Konflikty a priorita komponentov musia byť jasne otestované.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.