Slovník výrazov AI/Optimalizácia a trénovanie

Optimalizácia a trénovanie

dátový paralelizmus

Anglický výraz data parallelism

špecializovanéheslo č. 3965 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená dátový paralelizmus?

Dátový paralelizmus replikuje model na viacerých pracovníkoch, každému pridelí inú časť dávky a pred aktualizáciou zosynchronizuje gradienty. Pri synchrónnom DDP je výsledný gradient spriemerovaný alebo sčítaný podľa rámca a všetky repliky zostanú zhodné. Stratégia zvyšuje priepustnosť, ale nerieši model, ktorý sa nezmestí na jedno zariadenie.

Skúsenosť a kontext

Ako sa pojem používa v praxi

V PyTorch sa uprednostňuje jeden proces na GPU s DistributedDataParallel. DistributedSampler rozdelí tréningové indexy a na začiatku epochy dostane set_epoch, aby sa miešanie menilo konzistentne. Efektívny batch rastie s world size, preto sa preladí lr a warmup. Tím nepoužíva každému ranku celý validačný dataset bez korektnej agregácie a kontroluje, či nerovnaký počet krokov nespôsobí zablokovanie kolektívnych operácií.

Overiteľnosť

Odborné zdroje

  1. PyTorch · DistributedDataParalleldocs.pytorch.org
  2. PyTorch · Distributed communicationdocs.pytorch.org

Praktické odpovede

Často kladené otázky

Čo obsahuje každý pracovník?

Celý model a vlastný diel vstupnej dávky.

Ako sa spojí?

Kolektívnou redukciou medzi replikami pred rovnakým optimizer krokom.

Pomôže príliš veľkému modelu?

Nie zásadne, každá replika stále drží celý model.

Na čo slúži?

Rozdelí príklady medzi ranky a riadi ich miešanie bez nežiaduceho prekryvu.

Ako rastie efektívna veľkosť?

Lokálna dávka × world size × počet akumulačných krokov.