Datová integrita a evaluace

Únik cílové informace

Label leakage vzniká, když se informace o cílovém výsledku dostane do vstupních příznaků, procesu předzpracování nebo dělení dat způsobem, který nebude dostupný v okamihu reálné predikce. Může jít o přímý identifikátor výsledku, údaj vytvořený po události, agregaci vypočítanou i z validační množiny nebo proxy proměnnou tak tesne previazanou s labelom, že obchádza zamýšlanou úlohu. Leakage vede k nadhodnoteným metrikám a často se prejaví až prudkým poklesom výkonu po nasazení.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-L-05

Odborná definice

Odborná definice

Label leakage vzniká, když se informace o cílovém výsledku dostane do vstupních příznaků, procesu předzpracování nebo dělení dat způsobem, který nebude dostupný v okamihu reálné predikce. Může jít o přímý identifikátor výsledku, údaj vytvořený po události, agregaci vypočítanou i z validační množiny nebo proxy proměnnou tak tesne previazanou s labelom, že obchádza zamýšlanou úlohu. Leakage vede k nadhodnoteným metrikám a často se prejaví až prudkým poklesom výkonu po nasazení.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si model, který má predpovedat, či zákazník zruší smlouvu, ale mezi vstupmi dostane i datum uzavretia výpovědi. Na teste bude působit výnimočne, protože odpověď už nepřímo vidí. V provozu však tento údaj před rozhodnutím neexistuje. Únik může být méně nápadný, například při normalizaci vypočítanej z celého datasetu nebo při náhodnom rozdělení záznamů stejného pacienta do tréninku i testu. Rozhodujúca je simulace skutečného času, entity a informační hranice.

Časté otázky

Časté otázky

Jak se label leakage odlišuje od obecného data leakage?

Label leakage je konkrétní případ, při kterém vstupy obsahují cíl nebo jeho následok. Data leakage zahrnuje i jiné prenosy informace mezi tréninkem a hodnotením.

Proč ho náhodný train-test split nemusí odhalit?

Pokud jsou závislé záznamy nebo budoucí údaje rozdělené do obou množin, stejný chybný signál funguje na tréninku i teste a metrika zůstane vysoká.

Pomůže odstranit příznaky s extrémnou korelací?

Je to varovný test, ne úplné řešení. Leakage může být nelineárny, rozptýlený mezi více stlpců nebo ukrytý v textu a identifikátoroch.

Jak se kontroluje časový únik?

Pro každý příznak se eviduje event time a availability time. Hodnota je prípustná pouze tehdy, pokud byla skutečně dostupná před časem predikce.

Jaký audit je vhodný před nasazením?

Skontrolovat původ každého príznaku, pipeline fitovat pouze na tréninku, deliť data podle entít a času a porovnat offline schéma s produkčným tokom událostí.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Google ML, monitoring production pipelines

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.