Komprese a přenos chování modelu

Destilace znalostí

Knowledge distillation je tréninková technika, při které študentský model napodobňuje učitelský model nebo ensemble pomocí mekkých cílů, logitů, medzivrstvových reprezentací, attention máp nebo generovaných příkladů. Teplota zmekčuje pravděpodobnostní rozdělení a odhaluje vztahy mezi třídami, které one-hot štítek neobsahuje. Cílem bývá menší, rychlejší nebo lacnejší model, přičemž je třeba ověřit přenos chyb, biasu, kalibrace a bezpečnostného chování učitela. Destilačný cíl může kombinovat více lossů, kterých relativně váhy mění to, co študent prevezme.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-K-19

Odborná definice

Odborná definice

Knowledge distillation je tréninková technika, při které študentský model napodobňuje učitelský model nebo ensemble pomocí mekkých cílů, logitů, medzivrstvových reprezentací, attention máp nebo generovaných příkladů. Teplota zmekčuje pravděpodobnostní rozdělení a odhaluje vztahy mezi třídami, které one-hot štítek neobsahuje. Cílem bývá menší, rychlejší nebo lacnejší model, přičemž je třeba ověřit přenos chyb, biasu, kalibrace a bezpečnostného chování učitela. Destilačný cíl může kombinovat více lossů, kterých relativně váhy mění to, co študent prevezme.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Velký ensemble rozpoznáva obrázky přesně, ale na mobilnom zařízení je příliš pomalý. Menší model se netrénuje pouze na správné třídě. Dostane i informaci, že učitel při obrázku vlka priradil 70 procent vlkovi, 20 procent psovi a 8 procent líške. Tyto jemné pomery ukazují podobnost tříd a pomáhají študentovi naučit se hladšiu hranici. Pokud učitel systematicky zamieňa určitou menšinu, študent může tuto chybu prevziat a dokonca ji skrýt za nižší latenci. Menší model se musí testovat samostatně, protože stejné průměrné skóre může skrývat jiné typy chyb.

Časté otázky

Časté otázky

Co jsou měkké cíle?

Pravděpodobnostní výstupy učitela pro všechny třídy, ne pouze víťazný štítek. Nesou informaci o relatívnej podobnosti a neistote. Často se kombinují s původnými tvrdými štítkami.

Na co slouží teplota při destilaci?

Vyšší teplota zjemní rozdělení softmaxu a zvýrazní malé pravděpodobnosti nevýherných tříd. Při tréninku se vhodne škáluje i distilačná ztráta. Teplota a váhy lossů se validují společně.

Musí být učitel větší než študent?

Ne nevyhnutelně. Učitel může být ensemble, lépe optimalizovaný model, model s ďalšími modalitami nebo stejná architektura z jiné fáze. Podstatná je užitečná informace, kterou študent nemá v běžných štítcích.

Co je feature distillation?

Študent napodobňuje interní reprezentace učitela, ne pouze koncové logity. Pokud se rozměry vrstev liší, používá se projekce nebo adaptačný modul. Zvolená vrstva musí prenášat relevantní, ne náhodnou strukturu.

Jak se hodnotí úspešná destilace?

Porovnává se kvalita, kalibrace, robustnost, férovost, latence, spotreba paměti a energie vůči učitelovi i nedestilovanému študentovi. Menší pokles při hlavnej metrice nemusí ospravedlnit velké bezpečnostní zhoršení.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Hinton, Vinyals a Dean, Distilling the Knowledge Gou a kol., Knowledge Distillation Survey

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.