Evaluace sumarizace a generovaného textu

ROUGE

ROUGE je rodina automatických metrik, které porovnávají systémový souhrn s jedním nebo více referenčnými súhrnmi podle prekrytia textových jednotek. ROUGE-N pracuje s n-gramami, ROUGE-L s najdlhšou společnou podsekvencí a další varianty se skip-bigramami. Výsledek lze uvádět jako recall, precision nebo F1 podle implementace. Metrika zachycuje lexikálnu podobnost, ne úplnou sémantickou správnost, faktičnost, strukturu ani užitečnost. Hodnoty závisí na tokenizace, stemmingu a počtu referencií.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-25

Odborná definice

Odborná definice

ROUGE je rodina automatických metrik, které porovnávají systémový souhrn s jedním nebo více referenčnými súhrnmi podle prekrytia textových jednotek. ROUGE-N pracuje s n-gramami, ROUGE-L s najdlhšou společnou podsekvencí a další varianty se skip-bigramami. Výsledek lze uvádět jako recall, precision nebo F1 podle implementace. Metrika zachycuje lexikálnu podobnost, ne úplnou sémantickou správnost, faktičnost, strukturu ani užitečnost. Hodnoty závisí na tokenizace, stemmingu a počtu referencií.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

ROUGE kontroluje, nakolko se slovné kúsky vytvoreného súhrnu prekrývají s ludským referenčním textem. Pokud model použije stejné důležité slova a frázy, skóre roste. Dvě významově správně parafráze však mohou mít menší překryv a dostat slabšie hodnocení. Naopak, text může kopírovat mnoho slov a přitom skreslit vztahy mezi nimi. ROUGE je proto praktický na porovnávání systémů při stabilním protokole, ale nemá nahradit kontrolu faktickosti a lidský úsudok.

Časté otázky

Časté otázky

Jaký je rozdíl mezi ROUGE-1 a ROUGE-2?

ROUGE-1 porovnává jednotlivé tokeny, ROUGE-2 dvojice po sebe idúcich tokenů. Druhý variant je citlivější na lokálně formulace a bývá nižší.

Co měří ROUGE-L?

Využívá délku najdlhšej společné podsekvence, takže zohladňuje pořadí slov bez požadavky, aby všechny byly bezprostredne vedla sebe.

Znamená vysoké ROUGE fakticky správný souhrn?

Ne. Metrika může odmenit slovný překryv i při nesprávném pripísaní čísla, negaci nebo aktéra. Faktičnost potřebuje samostatnou evaluaci.

Proč je třeba uvést tokenizaci a stemming?

Rozdělení slov, normalizace a stemming mění počet zhůd. Bez stejného protokolu nejsou hodnoty mezi implementacemi nebo jazykmi přímo srovnatelné.

Je ROUGE vhodné na hodnocení odpovědí LLM?

Pouze při úlohách s referenčním textem a očakávaným lexikálnym prekryvom. Při otvorených odpovediach je třeba přidat semantické, faktické, bezpečnostní a lidské hodnocení.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Lin, ROUGE: A Package for Automatic Evaluation of Summaries, 2004

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.