Slovník výrazov AI/MLOps a nasadenie

MLOps a nasadenie

rozpočet latencie

Anglický výraz latency budget

špecializovanéheslo č. 9965 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená rozpočet latencie?

Rozpočet latencie je pridelenie maximálneho času jednotlivým krokom end-to-end požiadavky tak, aby celý systém splnil cieľ odozvy. Zahŕňa sieť, front, získanie príznakov, inferenciu a postprocessing a musí počítať s percentilmi aj rezervou, nie iba s priemermi.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Ak služba musí odpovedať do 200 ms na p99, tím pridelí 40 ms sieti, 60 ms príznakom, 70 ms modelu a 30 ms rezerve. Tracing ukáže, ktorý krok rozpočet míňa pri špičke.

Overiteľnosť

Odborné zdroje

  1. Google SRE - Service Level Objectivessre.google
  2. TensorFlow - TensorFlow Serving architecturetensorflow.org

Praktické odpovede

Často kladené otázky

Ako funguje rozpočet latencie?

Distribuované meranie rozloží čas požiadavky na úseky a každý komponent porovná svoju latenciu s pridelenou hranicou.

Kedy má rozpočet latencie praktický význam?

Ak služba musí odpovedať do 200 ms na p99, tím pridelí 40 ms sieti, 60 ms príznakom, 70 ms modelu a 30 ms rezerve.

S čím si pojem nezamieňať?

Latencia budget delí čas jednej odpovede; error budget určuje tolerovaný podiel udalostí, ktoré nesplnia SLO.

Ako sa výsledok kontroluje?

Sledujú sa p95/p99 úsekov aj celku, korelácia pri špičke, fronty, timeouty, rezerva a kritická cesta.

Na čo si dať pozor?

Súčty samostatných percentilov nemusia zodpovedať percentilu celku a paralelné kroky sa nepočítajú jednoduchým sčítaním.