Odborná definice
Odborná definice
Tensor parallelism rozděluje výpočet jedné vrstvy a její parametry mezi více akcelerátorů, typicky delením matic po riadkoch nebo stlpcoch. Každé zařízení zpracuje pouze část násobení, po které nasleduje kolektívna komunikace na sestavení výsledku. Umožňuje prevádzkovat model, kterého vrstvy se nezmestia na jeden čip, ale přidává synchronizaci a závisí na rychlé prepojovacej sítě. Liší se od data parallelismu, kde každé zařízení drží kopii modelu. Plán dělení se optimalizuje spolu s velikostí sítě, sekvencí a topológiou propojení mezi zariadeniami.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Pokud je jedna obrovská matice příliš velká pro jednu GPU, lze ji rozrezat na několik částí. Každá GPU vypočítá svoj diel a zařízení si následně vymení čiastočné výsledky. Výpočet jedné vrstvy tedy probíhá společně, ne na samostatných kópiách modelu. Výhodou je větší dostupná paměť pro parametry. Nevýhodou je komunikace při téměř každé vrstvě. Pokud je spojení mezi GPU pomalé, čas ušetrený paralelným násobením se může stratit při prenose dat. Nejlepší konfigurace na jednom serveri nemusí fungovat stejně při komunikaci mezi více uzlami.
Časté otázky
Časté otázky
Jak se tensor parallelism liší od pipeline parallelismu?
Tensor parallelism dělí jednotlivou operaci nebo vrstvu mezi zařízení. Pipeline parallelism rozděluje po sebe idúce skupiny vrstev a posouvá mezi nimi mikro-dávky.
Co je row-wise a column-wise dělení?
Při column-wise rozdělení drží zařízení vybrané sloupce váh a vytváří část výstupných prvků. Row-wise rozdělení dělí vstupní rozměr a vyžaduje sčítání čiastkových výsledků.
Kdy tensor parallelism neprinese zrychlení?
Při malém modeli, pomalej interconnect síti, malých dávkách nebo nevhodném rozdělení. Komunikačný čas může prevýšit úsporu lokálneho výpočtu.
Lze kombinovat s data parallelismom?
Ano. Skupina zařízení může společně držet jednu kopii modelu tensorovým paralelizmom a více takýchto skupin zpracovává odlišné dávky dat.
Co je třeba uložit v checkpoint-e?
Kromě parametrů i schéma shardování, verzi architektury, optimizer state a pravidla sestavení. Při změně počtu zařízení může být potřebné checkpoint preusporiadat.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- PyTorch Tensor Parallelism documentation Efficient Large-Scale Language Model Training on GPU Clusters
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
