Trénink klasifikačních a jazykových modelů

Křížová entropie jako ztrátová funkce

Cross entropy loss měří rozdíl mezi cielovým pravdepodobnostným rozdělením a distribúcí predikovanou modelem. Při klasifikaci s one-hot štítkem penalizuje záporný logaritmus pravděpodobnosti priradenej správné třídě, takže sebavedomá nesprávná predikce má velkou ztrátu. Při jazykovém modeli se počítá nad cielovým dalším tokenom na jednotlivých pozíciách. Funkce je diferencovatelná a přirozeně souvisí s maximálnou vierohodností, ale její nízká hodnota sama nezaručuje kalibraci, férovost ani úspěch provozního rozhodnutí.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-C-23

Odborná definice

Odborná definice

Cross entropy loss měří rozdíl mezi cielovým pravdepodobnostným rozdělením a distribúcí predikovanou modelem. Při klasifikaci s one-hot štítkem penalizuje záporný logaritmus pravděpodobnosti priradenej správné třídě, takže sebavedomá nesprávná predikce má velkou ztrátu. Při jazykovém modeli se počítá nad cielovým dalším tokenom na jednotlivých pozíciách. Funkce je diferencovatelná a přirozeně souvisí s maximálnou vierohodností, ale její nízká hodnota sama nezaručuje kalibraci, férovost ani úspěch provozního rozhodnutí.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pokud má obrázek správnou třídu mačka a model její přiřadí pravděpodobnost 0,9, trest je malý. Pokud její dá 0,01 a přitom je velmi presvedčený o psovi, ztráta prudko narastie. Trénink tak silně opravuje chyby, při kterých model podhodnotil správnou odpověď. Při LLM se stejný princip opakuje pro každý další token. Průměrná ztráta však může zakrýt zlé chování vzácné třídy a závisí na tokenizace či počtu možností. Proto se doplňa aplikačnými metrikami a segmentovou analýzou.

Časté otázky

Časté otázky

Je cross entropy stejná jako accuracy?

Ne. Accuracy počítá správně finálne štítky a ignoruje velikost istoty. Cross entropy pracuje s celou pravdepodobnostnou distribúcí a rozlišuje mezi mírně a extrémně chybnou predikcí. Modely s stejnou accuracy mohou mít velmi odlišnou ztrátu.

Proč se používá logaritmus pravděpodobnosti?

Součin pravděpodobností mnoha příkladů se po logaritme změní na součet, co je numericky i optimalizačne vhodné. Záporný log zároveň prudko trestá přiřazení téměř nulové pravděpodobnosti správné události a odpovídá maximum likelihood cielu.

Co je binary cross entropy?

Verze pro Bernoulliho cíl, která kombinuje ztrátu pozitivní i negativní třídy. Často se implementuje přímo z logitů kvůli numerické stabilite. Při multilabel klasifikaci se může počítat nezávisle pro každý štítek.

Jak se řeší class imbalance v této strate?

Jednotlivým triedam nebo příkladem lze přiřadit váhy, případně použít focal loss, která snižuje vliv lahkých příkladů. Váhy mění optimalizační cíl a musí se ladiť na validačních datech podle reálných nákladů chyb.

Souvisí cross entropy s perplexity?

Při jazykovém modeli je perplexity exponenciála průměrné tokenovej cross entropy při zvoleném logaritmickom základe. Nižší hodnota znamená, že model přiřazuje cielovým tokenom vyšší pravděpodobnost. Porovnání platí pouze při kompatibilnej tokenizaci a datasete.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Google Machine Learning Glossary, Metrics
  • Google Machine Learning Glossary

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.