Revize: 1. august 2026

Prořezávání modelu

Pruning odstraňuje nebo maskuje parametry, neuróny, kanály, attention hlavy či jiné struktury modelu, které se podle zvoleného kritéria považují za méně důležité. Unstructured pruning vytváří jednotlivé nulové váhy, structured pruning odstraňuje celé bloky kompatibilní s hustými výpočty. Metoda může proběhnout jednorazovo, iterativně nebo během tréninku a často po ní nasleduje fine-tuning. Cílem je menší model, nižší latence nebo energetická úspora, ale teoretická řídkost se zrýchlením prejaví pouze tehdy, když ji podporuje formát, kernel a cílový hardware.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-P-25

Odborná definice

Odborná definice

Pruning odstraňuje nebo maskuje parametry, neuróny, kanály, attention hlavy či jiné struktury modelu, které se podle zvoleného kritéria považují za méně důležité. Unstructured pruning vytváří jednotlivé nulové váhy, structured pruning odstraňuje celé bloky kompatibilní s hustými výpočty. Metoda může proběhnout jednorazovo, iterativně nebo během tréninku a často po ní nasleduje fine-tuning. Cílem je menší model, nižší latence nebo energetická úspora, ale teoretická řídkost se zrýchlením prejaví pouze tehdy, když ji podporuje formát, kernel a cílový hardware.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Síť má milióny váh, ale část z nich přispívá k výstupu jen málo. Pruning nastaví vybrané váhy na nulu nebo odstraní celé filtry a potom model doučí, aby obnovil kvalitu. Pokud vznikne náhodně roztrúsená řídkost, běžný procesor může stále provádět téměř stejnou práci. Odstranění celých kanálů se implementuje snazší, ale může poškodit reprezentaci více než jemné maskování. Proto se nehodnotí pouze percento núl, ale reálna latence, velikost artefaktu, přesnost kritických tříd a kompatibilita s ďalšou kvantizací.

Časté otázky

Časté otázky

Jaký je rozdíl mezi structured a unstructured pruningom?

Unstructured prerezáva jednotlivé váhy a vytváří nepravidelnou řídkost. Structured odstraňuje celé kanály, filtry nebo bloky, které se jednodušší premietnu do menších hustých matic.

Jako funguje pruning podle velikosti váhy?

Vybírá váhy s najmenšou absolútnou hodnotou podle predpokladu, že mají menší vliv. Je jednoduché, ale ignoruje citlivost ztráty a interakce mezi parametry.

Proč se model po pruningu znovu dolaďuje?

Odstranění spojení mění výpočty a zvyšné parametry se musí přizpůsobit. Iterativně prořezávání s krátkym fine-tuningom často zachová kvalitu lépe než jednorazový velký zásah.

Zrýchli 50 procent nulových váh inference dvojnásobne?

Ne automaticky. Nepravidelná řídkost potřebuje sparse kernel, přináší indexovou réžiu a může být limitovaná pamětí. Reálně zrychlení se měří na cílovém zařízení.

Lze pruning kombinovat s kvantizací?

Ano, obě metody snižují náklady jiným způsobem. Pořadí a společné dolaďování ovlivňují kvalitu, proto je třeba testovat konkrétní sparsity pattern, bitovou přesnost a runtime.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • PyTorch, Sparsity overview
  • PyTorch, Pruning methods

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.