Odborná definícia
Odborná definícia
Cross entropy loss meria rozdiel medzi cieľovým pravdepodobnostným rozdelením a distribúciou predikovanou modelom. Pri klasifikácii s one-hot štítkom penalizuje záporný logaritmus pravdepodobnosti priradenej správnej triede, takže sebavedomá nesprávna predikcia má veľkú stratu. Pri jazykovom modeli sa počíta nad cieľovým ďalším tokenom na jednotlivých pozíciách. Funkcia je diferencovateľná a prirodzene súvisí s maximálnou vierohodnosťou, no jej nízka hodnota sama nezaručuje kalibráciu, férovosť ani úspech prevádzkového rozhodnutia.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Ak má obrázok správnu triedu mačka a model jej priradí pravdepodobnosť 0,9, trest je malý. Ak jej dá 0,01 a pritom je veľmi presvedčený o psovi, strata prudko narastie. Tréning tak silno opravuje chyby, pri ktorých model podhodnotil správnu odpoveď. Pri LLM sa rovnaký princíp opakuje pre každý ďalší token. Priemerná strata však môže zakryť zlé správanie zriedkavej triedy a závisí od tokenizácie či počtu možností. Preto sa dopĺňa aplikačnými metrikami a segmentovou analýzou.
Časté otázky
Časté otázky
Je cross entropy rovnaká ako accuracy?
Nie. Accuracy počíta správne finálne štítky a ignoruje veľkosť istoty. Cross entropy pracuje s celou pravdepodobnostnou distribúciou a rozlišuje medzi mierne a extrémne chybnou predikciou. Modely s rovnakou accuracy môžu mať veľmi odlišnú stratu.
Prečo sa používa logaritmus pravdepodobnosti?
Súčin pravdepodobností mnohých príkladov sa po logaritme zmení na súčet, čo je numericky aj optimalizačne vhodné. Záporný log zároveň prudko trestá priradenie takmer nulovej pravdepodobnosti správnej udalosti a zodpovedá maximum likelihood cieľu.
Čo je binary cross entropy?
Verzia pre Bernoulliho cieľ, ktorá kombinuje stratu pozitívnej aj negatívnej triedy. Často sa implementuje priamo z logitov kvôli numerickej stabilite. Pri multilabel klasifikácii sa môže počítať nezávisle pre každý štítok.
Ako sa rieši class imbalance v tejto strate?
Jednotlivým triedam alebo príkladom možno priradiť váhy, prípadne použiť focal loss, ktorá znižuje vplyv ľahkých príkladov. Váhy menia optimalizačný cieľ a musia sa ladiť na validačných dátach podľa reálnych nákladov chýb.
Súvisí cross entropy s perplexity?
Pri jazykovom modeli je perplexity exponenciála priemernej tokenovej cross entropy pri zvolenom logaritmickom základe. Nižšia hodnota znamená, že model priraďuje cieľovým tokenom vyššiu pravdepodobnosť. Porovnanie platí iba pri kompatibilnej tokenizácii a datasete.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Google Machine Learning Glossary, Metrics
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
