Komprese a efektivní inference

prořezávání váh modelu

Weight pruning je odstranění nebo maskování parametrů, kterých příspěvek se podle zvoleného kritéria považuje za postrádatelný. Neštrukturálny pruning nulujeme jednotlivé prvky tenzora, štrukturálny odstraňuje celé kanály, hlavy, neuróny nebo bloky. Prořezávání může proběhnout jednorazovo, iterativně, během tréninku nebo po ňom a často ho nasleduje dolaďování. Počet núl není automaticky rovný zrychlení, protože reálný přínos závisí na formátu sparsity, kernelů, hardwaru a nákladů na indexování. Kvalita se musí hodnotit po exporte na cílové platforme.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-14

Odborná definice

Odborná definice

Weight pruning je odstranění nebo maskování parametrů, kterých příspěvek se podle zvoleného kritéria považuje za postrádatelný. Neštrukturálny pruning nulujeme jednotlivé prvky tenzora, štrukturálny odstraňuje celé kanály, hlavy, neuróny nebo bloky. Prořezávání může proběhnout jednorazovo, iterativně, během tréninku nebo po ňom a často ho nasleduje dolaďování. Počet núl není automaticky rovný zrychlení, protože reálný přínos závisí na formátu sparsity, kernelů, hardwaru a nákladů na indexování. Kvalita se musí hodnotit po exporte na cílové platforme.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Model může obsahovat množství spojení, které po tréninku ovlivňují výstup jen málo. Pruning jejich označí maskou nebo odstraní, podobně jako když se z hustej sítě ciest ponechají pouze trasy potřebné pro dopravu. Pokud se vynechávají jednotlivé čísla, vznikne velká matematická řídkost, kterou běžný procesor nemusí vědět využit. Odstranění celého kanála nebo attention hlavy se implementuje jednodušší, ale může zasáhnout důležitou strukturu. Proto se sleduje nejen přesnost, ale i skutečná paměť, latence a energetická spotreba.

Časté otázky

Časté otázky

Co je magnitude pruning?

Parametry s najmenšou absolútnou hodnotou se považují za méně důležité a vynulují se. Je jednoduchý, ale ignoruje interakce, gradienty a citlivost vrstev.

Jaký je rozdíl mezi structured a unstructured pruning?

Unstructured odstraní jednotlivé váhy, structured celé pravidelné jednotky. Druhý typ bývá snazší zrýchlitelný na štandardnom hardwaru.

Proč se model po pruningu dolaďuje?

Zostávajúce parametry se musí přizpůsobit strate kapacity. Fine-tuning může obnovit část přesnosti, pokud pruning neodstránil nenahraditelné funkce.

Je vysoká sparsity automaticky dobrá?

Ne. Deveťdesiat procent núl může zůstat pomalších než hustý menší model, pokud runtime nepodporuje daný vzor riedkosti nebo vznikají náklady na nepravidelný přístup.

Jak se porovnávají pruned modely?

Je třeba uvést základní model, typ masky, globální nebo lokální práh, fine-tuning, velikost souboru, podporu runtime, latenci a kvalitu na stejném teste.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • PyTorch, Pruning Tutorial Deep Compression

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.