Slovník výrazov AI/Optimalizácia a trénovanie

Optimalizácia a trénovanie

tenzorový paralelizmus

Anglický výraz tensor parallelism

špecializovanéheslo č. 3995 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená tenzorový paralelizmus?

Tenzorový paralelizmus rozdeľuje jednu veľkú operáciu a jej parametre po dimenziách medzi zariadenia. Maticové násobenie môže rozdeliť stĺpce alebo riadky váh; čiastkové výsledky sa potom spájajú all-gatherom, all-reduce alebo reduce-scatterom. Na rozdiel od pipeline pracujú zariadenia na tej istej vrstve súčasne, preto komunikujú vo vnútri takmer každého rozdeleného bloku.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Používa sa pri veľkých transformátoroch, keď jednotlivé vrstvy alebo optimizer stav nezmestia na jednu GPU. Tím volí tensor-parallel group podľa rýchlej lokálnej siete, kontroluje deliteľnosť rozmerov počtom zariadení a profiluje kolektívne operácie. Príliš široká skupina môže stratiť viac na komunikácii, než získa výpočtom. Numerické výsledky sa porovnajú s nedeleným modelom na malej konfigurácii a checkpoint má zdokumentované pravidlo shardovania.

Overiteľnosť

Odborné zdroje

  1. Shoeybi et al. · Megatron-LMarxiv.org
  2. PyTorch · Distributed communicationdocs.pytorch.org

Praktické odpovede

Často kladené otázky

Čo sa delí?

Vybraná dimenzia váh, aktivácií alebo hláv jednej operácie.

Kedy pracujú zariadenia?

Súčasne na rôznych častiach tej istej vrstvy.

Prečo sú potrebné?

Čiastkové výstupy alebo gradienty sa musia zložiť či prerozdeliť.

Čo kontrolovať?

Skryté rozmery, hlavy a slovník musia vyhovovať zvolenému počtu shardov.

Kam umiestniť skupinu?

Na zariadenia s najrýchlejším vzájomným prepojením.