Slovník výrazov AI/Hardvér a efektívny výpočet

Hardvér a efektívny výpočet

latencia inferencie

Anglický výraz inference latency

špecializovanéheslo č. 14465 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená latencia inferencie?

Latencia inferencie je čas od pripraveného vstupu po dostupný výstup modelu alebo celého aplikačného pipeline. Má sa uvádzať ako distribúcia, napríklad p50 a p99, s presným rozsahom merania.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Služba meria end-to-end p50, p95 a p99 vrátane preprocessingu, fronty, prenosov a postprocessingu pri očakávanej konkurencii.

Overiteľnosť

Odborné zdroje

  1. NVIDIA - TensorRT performance benchmarkingdocs.nvidia.com
  2. NVIDIA - TensorRT documentationdocs.nvidia.com

Praktické odpovede

Často kladené otázky

Čo presne znamená latencia inferencie?

Latencia inferencie je čas od pripraveného vstupu po dostupný výstup modelu alebo celého aplikačného pipeline.

Kedy sa latencia inferencie používa?

Služba meria end-to-end p50, p95 a p99 vrátane preprocessingu, fronty, prenosov a postprocessingu pri očakávanej konkurencii.

Od čoho treba latencia inferencie odlíšiť?

Priepustnosť udáva počet dokončených úloh za čas. Inference latencia udáva, ako dlho čaká jednotlivá požiadavka.

Ako sa latencia inferencie kontroluje?

Overuje sa začiatok a koniec časovania, warm-up, batch, concurrency, input size, synchronizácia GPU, cold start a percentily.

Aké obmedzenie má latencia inferencie?

Priemer zakryje dlhý chvost a izolovaný benchmark bez fronty či prenosu výrazne podhodnotí používateľskú odozvu.