Evaluácia strojového prekladu a generovania

BLEU score

Bilingual Evaluation Understudy

BLEU je automatická metrika, ktorá porovnáva n-gramovú zhodu kandidátskeho prekladu s jedným alebo viacerými referenčnými prekladmi. Používa modifikovanú precision pre n-gramy a brevity penalty, ktorá penalizuje príliš krátke výstupy. Skóre sa pôvodne navrhlo na hodnotenie kvality systému na úrovni korpusu, nie ako spoľahlivý verdikt o jednej vete. BLEU nezachytáva úplne význam, faktickosť, štýl ani prijateľné parafrázy, preto sa má interpretovať spolu s ľudským hodnotením a ďalšími metrikami.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-B-21

Odborná definícia

Odborná definícia

BLEU je automatická metrika, ktorá porovnáva n-gramovú zhodu kandidátskeho prekladu s jedným alebo viacerými referenčnými prekladmi. Používa modifikovanú precision pre n-gramy a brevity penalty, ktorá penalizuje príliš krátke výstupy. Skóre sa pôvodne navrhlo na hodnotenie kvality systému na úrovni korpusu, nie ako spoľahlivý verdikt o jednej vete. BLEU nezachytáva úplne význam, faktickosť, štýl ani prijateľné parafrázy, preto sa má interpretovať spolu s ľudským hodnotením a ďalšími metrikami.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Ak referenčný preklad znie „Model spracuje údaje rýchlo“ a systém vytvorí veľmi podobnú vetu, BLEU nájde zhodné jedno až viacslovné úseky. Ak model vynechá polovicu obsahu, brevity penalty zníži skóre, aby krátka veta nevyhrala iba vysokou presnosťou zhôd. Dobrá parafráza však môže použiť iné slová a dostať nižšie skóre, hoci človek ju považuje za správnu. Preto BLEU funguje lepšie pri porovnaní veľkých súborov prekladov než pri posudzovaní jednej odpovede alebo otvoreného kreatívneho textu.

Časté otázky

Časté otázky

Čo znamená BLEU 30 alebo 0,30?

Nástroje môžu skóre zobrazovať na škále 0 až 1 alebo 0 až 100. Hodnoty sú porovnateľné iba pri rovnakom tokenizovaní, referenciách, vyhladzovaní a datasete. Samotné číslo nemá univerzálnu slovnú známku kvality.

Prečo BLEU používa viac n-gramových rádov?

Unigramy zachytávajú slovnú zhodu, vyššie n-gramy čiastočne odmeňujú lokálny slovosled a frázy. Geometrický priemer zabraňuje tomu, aby systém získal vysoké skóre iba množstvom správnych jednotlivých slov bez súvislých úsekov.

Na čo slúži brevity penalty?

Bez nej by veľmi krátky výstup mohol dosiahnuť vysokú precision, pretože obsahuje málo nesprávnych slov. Penalizácia porovná dĺžku kandidáta s efektívnou referenčnou dĺžkou a zníži skóre pri nedostatočnom pokrytí.

Je BLEU vhodné na hodnotenie chatbotov?

Zvyčajne nie ako hlavná metrika. Na jednu otázku existuje mnoho platných odpovedí s nízkou n-gramovou zhodou. Potrebné sú testy faktickosti, užitočnosti, bezpečnosti, plnenia inštrukcií a ľudské alebo modelové hodnotenie s kalibráciou.

Prečo výsledok závisí od tokenizácie?

Rozdelenie textu na tokeny určuje, ktoré n-gramy sa porovnávajú. Interpunkcia, zložené slová a segmentácia môžu zmeniť počet zhôd. Reprodukovateľný report musí uviesť implementáciu a konfiguráciu, napríklad sacreBLEU signature.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Papineni a kol., BLEU: a Method for Automatic Evaluation of Machine Translation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.