Presná definícia
Čo znamená tenzorový paralelizmus?
Tenzorový paralelizmus rozdeľuje jednu veľkú operáciu a jej parametre po dimenziách medzi zariadenia. Maticové násobenie môže rozdeliť stĺpce alebo riadky váh; čiastkové výsledky sa potom spájajú all-gatherom, all-reduce alebo reduce-scatterom. Na rozdiel od pipeline pracujú zariadenia na tej istej vrstve súčasne, preto komunikujú vo vnútri takmer každého rozdeleného bloku.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Používa sa pri veľkých transformátoroch, keď jednotlivé vrstvy alebo optimizer stav nezmestia na jednu GPU. Tím volí tensor-parallel group podľa rýchlej lokálnej siete, kontroluje deliteľnosť rozmerov počtom zariadení a profiluje kolektívne operácie. Príliš široká skupina môže stratiť viac na komunikácii, než získa výpočtom. Numerické výsledky sa porovnajú s nedeleným modelom na malej konfigurácii a checkpoint má zdokumentované pravidlo shardovania.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Čo sa delí?
Vybraná dimenzia váh, aktivácií alebo hláv jednej operácie.
Kedy pracujú zariadenia?
Súčasne na rôznych častiach tej istej vrstvy.
Prečo sú potrebné?
Čiastkové výstupy alebo gradienty sa musia zložiť či prerozdeliť.
Čo kontrolovať?
Skryté rozmery, hlavy a slovník musia vyhovovať zvolenému počtu shardov.
Kam umiestniť skupinu?
Na zariadenia s najrýchlejším vzájomným prepojením.
Prihlásiť / registrovať