Presná definícia
Čo znamená latencia inferencie?
Latencia inferencie je čas od pripraveného vstupu po dostupný výstup modelu alebo celého aplikačného pipeline. Má sa uvádzať ako distribúcia, napríklad p50 a p99, s presným rozsahom merania.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Služba meria end-to-end p50, p95 a p99 vrátane preprocessingu, fronty, prenosov a postprocessingu pri očakávanej konkurencii.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Čo presne znamená latencia inferencie?
Latencia inferencie je čas od pripraveného vstupu po dostupný výstup modelu alebo celého aplikačného pipeline.
Kedy sa latencia inferencie používa?
Služba meria end-to-end p50, p95 a p99 vrátane preprocessingu, fronty, prenosov a postprocessingu pri očakávanej konkurencii.
Od čoho treba latencia inferencie odlíšiť?
Priepustnosť udáva počet dokončených úloh za čas. Inference latencia udáva, ako dlho čaká jednotlivá požiadavka.
Ako sa latencia inferencie kontroluje?
Overuje sa začiatok a koniec časovania, warm-up, batch, concurrency, input size, synchronizácia GPU, cold start a percentily.
Aké obmedzenie má latencia inferencie?
Priemer zakryje dlhý chvost a izolovaný benchmark bez fronty či prenosu výrazne podhodnotí používateľskú odozvu.
Prihlásiť / registrovať