Evaluace strojového překladu a generování

BLEU score

BLEU je automatická metrika, která porovnává n-gramovou shodu kandidátskeho překladu s jedním nebo více referenčnými prekladmi. Používá modifikovanou precision pro n-gramy a brevity penalty, která penalizuje příliš krátké výstupy. Skóre se původne navrhlo na hodnocení kvality systému na úrovni korpusu, ne jako spolehlivý verdikt o jedné vete. BLEU nezachytáva zcela význam, faktičnost, styl ani prijatelné parafráze, proto se má interpretovat spolu s ludským hodnotením a ďalšími metrikami.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-B-21

Odborná definice

Odborná definice

BLEU je automatická metrika, která porovnává n-gramovou shodu kandidátskeho překladu s jedním nebo více referenčnými prekladmi. Používá modifikovanou precision pro n-gramy a brevity penalty, která penalizuje příliš krátké výstupy. Skóre se původne navrhlo na hodnocení kvality systému na úrovni korpusu, ne jako spolehlivý verdikt o jedné vete. BLEU nezachytáva zcela význam, faktičnost, styl ani prijatelné parafráze, proto se má interpretovat spolu s ludským hodnotením a ďalšími metrikami.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pokud referenční překlad zní „Model zpracuje údaje rychle“ a systém vytvoří velmi podobnou větu, BLEU najde zhodné jedno až viacslovné úseky. Pokud model vynechá polovicu obsahu, brevity penalty sníží skóre, aby krátka věta nevyhrala pouze vysokou přesností zhůd. Dobrá parafráza však může použít jiné slova a dostat nižší skóre, ačkoli člověk ji považuje za správnou. Proto BLEU funguje lépe při porovnání velkých souborů prekladů než při posuzování jedné odpovědi nebo otevřeného kreatívneho textu.

Časté otázky

Časté otázky

Co znamená BLEU 30 nebo 0,30?

Nástroje mohou skóre zobrazovat na škále 0 až 1 nebo 0 až 100. Hodnoty jsou srovnatelné pouze při stejném tokenizování, referenciách, vyhlazování a datasete. Samotné číslo nemá univerzálnu slovnou známku kvality.

Proč BLEU používá více n-gramových rádů?

Unigramy zachycují slovnou shodu, vyšší n-gramy částečně odmeňují lokální slovosled a frázy. Geometrický průměr zabraňuje tomu, aby systém získal vysoké skóre pouze množstvím správných jednotlivých slov bez súvislých úseků.

Na co slouží brevity penalty?

Bez ní by velmi krátký výstup mohl dosáhnout vysokou precision, protože obsahuje málo nesprávnych slov. Penalizace porovná délku kandidáta s efektívnou referenčnou délkou a sníží skóre při nedostatočnom pokrytí.

Je BLEU vhodné na hodnocení chatbotů?

Obvykle ne jako hlavná metrika. Na jednu otázku existuje mnoho platných odpovědí s nízkou n-gramovou zhodou. Potřebné jsou testy faktickosti, užitečnosti, bezpečnosti, plnení instrukcí a lidské nebo modelové hodnocení s kalibrací.

Proč výsledek závisí na tokenizace?

Rozdělení textu na tokeny určuje, které n-gramy se porovnávají. Interpunkce, složené slova a segmentace mohou změnit počet zhůd. Reprodukovatelný report musí uvést implementaci a konfiguraci, například sacrebleu signature.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Papineni a kol., BLEU: a Method for Automatic Evaluation of Machine Translation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.