Slovník výrazov AI/MLOps a nasadenie

MLOps a nasadenie

automatické škálovanie

Anglický výraz autoscaling

špecializovanéheslo č. 9985 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená automatické škálovanie?

Automatické škálovanie dynamicky mení počet replík alebo pridelené zdroje podľa pozorovaných metrík a cieľov. Pri modelovom servingu musí zohľadniť čas štartu a načítania modelu, front, súbežnosť, akcelerátory, minimálnu kapacitu a ochranu pred osciláciou.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Endpoint škáluje podľa dĺžky frontu a GPU využitia, nie iba CPU. Udržiava dve zahriate repliky, rastie rýchlejšie než klesá a pri novej verzii overí, že kapacita stačí aj počas rollout-u.

Overiteľnosť

Odborné zdroje

  1. Kubernetes - Horizontal Pod Autoscalingkubernetes.io
  2. TensorFlow - TensorFlow Serving architecturetensorflow.org

Praktické odpovede

Často kladené otázky

Ako funguje automatické škálovanie?

Controller periodicky porovná metriku s cieľom a upraví požadovaný počet replík v rámci miním, maxím a stabilizačných okien.

Kedy má automatické škálovanie praktický význam?

Endpoint škáluje podľa dĺžky frontu a GPU využitia, nie iba CPU.

S čím si pojem nezamieňať?

Autoscaling mení kapacitu podľa dopytu; load balancing rozdeľuje aktuálnu premávku medzi už dostupné inštancie.

Ako sa výsledok kontroluje?

Testujú sa špičky, cold start, limity, stabilita, strata uzla, rollout, latencia, náklady a správanie pri nedostupnej metrike.

Na čo si dať pozor?

Pomalé načítanie veľkého modelu môže spôsobiť, že škálovanie zareaguje až po vyčerpaní latencie a frontu.