Evaluácia sumarizácie a generovaného textu

ROUGE

Recall-Oriented Understudy for Gisting Evaluation

ROUGE je rodina automatických metrík, ktoré porovnávajú systémový súhrn s jedným alebo viacerými referenčnými súhrnmi podľa prekrytia textových jednotiek. ROUGE-N pracuje s n-gramami, ROUGE-L s najdlhšou spoločnou podsekvenciou a ďalšie varianty so skip-bigramami. Výsledok možno uvádzať ako recall, precision alebo F1 podľa implementácie. Metrika zachytáva lexikálnu podobnosť, nie úplnú sémantickú správnosť, faktickosť, štruktúru ani užitočnosť. Hodnoty závisia od tokenizácie, stemmingu a počtu referencií.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-25

Odborná definícia

Odborná definícia

ROUGE je rodina automatických metrík, ktoré porovnávajú systémový súhrn s jedným alebo viacerými referenčnými súhrnmi podľa prekrytia textových jednotiek. ROUGE-N pracuje s n-gramami, ROUGE-L s najdlhšou spoločnou podsekvenciou a ďalšie varianty so skip-bigramami. Výsledok možno uvádzať ako recall, precision alebo F1 podľa implementácie. Metrika zachytáva lexikálnu podobnosť, nie úplnú sémantickú správnosť, faktickosť, štruktúru ani užitočnosť. Hodnoty závisia od tokenizácie, stemmingu a počtu referencií.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

ROUGE kontroluje, nakoľko sa slovné kúsky vytvoreného súhrnu prekrývajú s ľudským referenčným textom. Ak model použije rovnaké dôležité slová a frázy, skóre rastie. Dve významovo správne parafrázy však môžu mať menší prekryv a dostať slabšie hodnotenie. Naopak, text môže kopírovať veľa slov a pritom skresliť vzťahy medzi nimi. ROUGE je preto praktický na porovnávanie systémov pri stabilnom protokole, ale nemá nahradiť kontrolu faktickosti a ľudský úsudok.

Časté otázky

Časté otázky

Aký je rozdiel medzi ROUGE-1 a ROUGE-2?

ROUGE-1 porovnáva jednotlivé tokeny, ROUGE-2 dvojice po sebe idúcich tokenov. Druhý variant je citlivejší na lokálne formulácie a býva nižší.

Čo meria ROUGE-L?

Využíva dĺžku najdlhšej spoločnej podsekvencie, takže zohľadňuje poradie slov bez požiadavky, aby všetky boli bezprostredne vedľa seba.

Znamená vysoké ROUGE fakticky správny súhrn?

Nie. Metrika môže odmeniť slovný prekryv aj pri nesprávnom pripísaní čísla, negácii alebo aktéra. Faktickosť potrebuje samostatnú evaluáciu.

Prečo treba uviesť tokenizáciu a stemming?

Rozdelenie slov, normalizácia a stemming menia počet zhôd. Bez rovnakého protokolu nie sú hodnoty medzi implementáciami alebo jazykmi priamo porovnateľné.

Je ROUGE vhodné na hodnotenie odpovedí LLM?

Iba pri úlohách s referenčným textom a očakávaným lexikálnym prekryvom. Pri otvorených odpovediach treba pridať semantické, faktické, bezpečnostné a ľudské hodnotenie.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Lin, ROUGE: A Package for Automatic Evaluation of Summaries, 2004

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.