Distribuovaný trénink a inference

tensorový paralelismus

Tensor parallelism rozděluje výpočet jedné vrstvy a její parametry mezi více akcelerátorů, typicky delením matic po riadkoch nebo stlpcoch. Každé zařízení zpracuje pouze část násobení, po které nasleduje kolektívna komunikace na sestavení výsledku. Umožňuje prevádzkovat model, kterého vrstvy se nezmestia na jeden čip, ale přidává synchronizaci a závisí na rychlé prepojovacej sítě. Liší se od data parallelismu, kde každé zařízení drží kopii modelu. Plán dělení se optimalizuje spolu s velikostí sítě, sekvencí a topológiou propojení mezi zariadeniami.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-07

Odborná definice

Odborná definice

Tensor parallelism rozděluje výpočet jedné vrstvy a její parametry mezi více akcelerátorů, typicky delením matic po riadkoch nebo stlpcoch. Každé zařízení zpracuje pouze část násobení, po které nasleduje kolektívna komunikace na sestavení výsledku. Umožňuje prevádzkovat model, kterého vrstvy se nezmestia na jeden čip, ale přidává synchronizaci a závisí na rychlé prepojovacej sítě. Liší se od data parallelismu, kde každé zařízení drží kopii modelu. Plán dělení se optimalizuje spolu s velikostí sítě, sekvencí a topológiou propojení mezi zariadeniami.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pokud je jedna obrovská matice příliš velká pro jednu GPU, lze ji rozrezat na několik částí. Každá GPU vypočítá svoj diel a zařízení si následně vymení čiastočné výsledky. Výpočet jedné vrstvy tedy probíhá společně, ne na samostatných kópiách modelu. Výhodou je větší dostupná paměť pro parametry. Nevýhodou je komunikace při téměř každé vrstvě. Pokud je spojení mezi GPU pomalé, čas ušetrený paralelným násobením se může stratit při prenose dat. Nejlepší konfigurace na jednom serveri nemusí fungovat stejně při komunikaci mezi více uzlami.

Časté otázky

Časté otázky

Jak se tensor parallelism liší od pipeline parallelismu?

Tensor parallelism dělí jednotlivou operaci nebo vrstvu mezi zařízení. Pipeline parallelism rozděluje po sebe idúce skupiny vrstev a posouvá mezi nimi mikro-dávky.

Co je row-wise a column-wise dělení?

Při column-wise rozdělení drží zařízení vybrané sloupce váh a vytváří část výstupných prvků. Row-wise rozdělení dělí vstupní rozměr a vyžaduje sčítání čiastkových výsledků.

Kdy tensor parallelism neprinese zrychlení?

Při malém modeli, pomalej interconnect síti, malých dávkách nebo nevhodném rozdělení. Komunikačný čas může prevýšit úsporu lokálneho výpočtu.

Lze kombinovat s data parallelismom?

Ano. Skupina zařízení může společně držet jednu kopii modelu tensorovým paralelizmom a více takýchto skupin zpracovává odlišné dávky dat.

Co je třeba uložit v checkpoint-e?

Kromě parametrů i schéma shardování, verzi architektury, optimizer state a pravidla sestavení. Při změně počtu zařízení může být potřebné checkpoint preusporiadat.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • PyTorch Tensor Parallelism documentation Efficient Large-Scale Language Model Training on GPU Clusters

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.