Priemer nestačí; osobitne sledujte kritické chyby, segmenty, cenu a stabilitu.
Jedna pôsobivá odpoveď nie je dôkaz. Prompt treba porovnať s baseline na reprezentatívnej golden set a samostatne sledovať kritické chyby, segmenty, stabilitu, cenu a latenciu.
Po prečítaní budete vedieť
- vytvoriť reprezentatívnu golden set s držanou časťou
- kombinovať deterministické, ľudské a modelové hodnotenie
- nastaviť release prahy, monitoring a regresné testy
Celá kapitola je zadarmo po registrácii.
- Čo presne testujete
- Z požiadavky vytvorte metriku
- Golden set je živá referenčná sada
- Referenčná odpoveď nemusí byť jedna veta
- Deterministické kontroly použite ako prvé
- Ľudské hodnotenie
- LLM ako hodnotiteľ
- A/B test promptov
Prihlásenie zabezpečuje ChatGPT. PoznAI nedostane vaše heslo.
Praktické odpovede
Často kladené otázky
Koľko testovacích prípadov stačí?
Neexistuje univerzálne číslo. Sada musí pokryť bežné vstupy, hranice a všetky chyby s vysokým následkom; dôležitejšie je pokrytie než samotný počet.
Môže prompty hodnotiť iný LLM?
Áno ako škálovateľný signál, ak má jasnú rubriku a je kalibrovaný proti odborníkom. Pri kritickej úlohe nemá byť jedinou release bránou.
Prečo nestačí priemerné skóre?
Priemer môže zakryť regresiu v malej, ale závažnej skupine. Sledujte segmenty a kritické chyby osobitne.
Prihlásiť / registrovať