Presná definícia
Čo znamená dátový paralelizmus?
Dátový paralelizmus replikuje model na viacerých pracovníkoch, každému pridelí inú časť dávky a pred aktualizáciou zosynchronizuje gradienty. Pri synchrónnom DDP je výsledný gradient spriemerovaný alebo sčítaný podľa rámca a všetky repliky zostanú zhodné. Stratégia zvyšuje priepustnosť, ale nerieši model, ktorý sa nezmestí na jedno zariadenie.
Skúsenosť a kontext
Ako sa pojem používa v praxi
V PyTorch sa uprednostňuje jeden proces na GPU s DistributedDataParallel. DistributedSampler rozdelí tréningové indexy a na začiatku epochy dostane set_epoch, aby sa miešanie menilo konzistentne. Efektívny batch rastie s world size, preto sa preladí lr a warmup. Tím nepoužíva každému ranku celý validačný dataset bez korektnej agregácie a kontroluje, či nerovnaký počet krokov nespôsobí zablokovanie kolektívnych operácií.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Čo obsahuje každý pracovník?
Celý model a vlastný diel vstupnej dávky.
Ako sa spojí?
Kolektívnou redukciou medzi replikami pred rovnakým optimizer krokom.
Pomôže príliš veľkému modelu?
Nie zásadne, každá replika stále drží celý model.
Na čo slúži?
Rozdelí príklady medzi ranky a riadi ich miešanie bez nežiaduceho prekryvu.
Ako rastie efektívna veľkosť?
Lokálna dávka × world size × počet akumulačných krokov.
Prihlásiť / registrovať