Slovník výrazov AI/Hardvér a efektívny výpočet

Hardvér a efektívny výpočet

kvantizácia modelu

Anglický výraz model quantization

základnéheslo č. 14205 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená kvantizácia modelu?

Kvantizácia modelu nahrádza alebo aproximuje váhy a aktivácie formátmi s nižšou bitovou šírkou, napríklad FP16 alebo INT8. Znižuje veľkosť, prenos dát a často latenciu, pričom môže pridať chybu zaokrúhlenia.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Tím kvantizuje model na cieľový runtime, kalibruje reprezentatívnymi dátami a porovná presnosť po triedach, model size, latenciu a energiu.

Overiteľnosť

Odborné zdroje

  1. TensorFlow - Model Optimizationtensorflow.org
  2. PyTorch - Quantization documentationdocs.pytorch.org

Praktické odpovede

Často kladené otázky

Čo presne znamená kvantizácia modelu?

Kvantizácia modelu nahrádza alebo aproximuje váhy a aktivácie formátmi s nižšou bitovou šírkou, napríklad FP16 alebo INT8.

Kedy sa kvantizácia modelu používa?

Tím kvantizuje model na cieľový runtime, kalibruje reprezentatívnymi dátami a porovná presnosť po triedach, model size, latenciu a energiu.

Od čoho treba kvantizácia modelu odlíšiť?

Pruning odstraňuje vybrané váhy alebo štruktúry. Quantization zachováva operácie, ale mení číselnú reprezentáciu.

Ako sa kvantizácia modelu kontroluje?

Kontroluje sa dtype váh a aktivácií, scale a zero-point, per-channel nastavenie, kalibračný set, accuracy a device benchmark.

Aké obmedzenie má kvantizácia modelu?

Outliery v aktiváciách môžu spotrebovať dynamický rozsah a formálne menší model nemusí zrýchliť runtime bez podpory daného formátu.