Prompt engineering: Umenie komunikácie s AI

Testovanie promptov: ako nahradiť dojem dôkazom

Začiatočník48 min čítania22 častíZadarmo po registrácii
Lekcia12
Eval slučkaDojem nahrádza merateľný test
01Golden set
02Baseline
03Variant
04Rubrika
05Regresie
06Release

Priemer nestačí; osobitne sledujte kritické chyby, segmenty, cenu a stabilitu.

Jedna pôsobivá odpoveď nie je dôkaz. Prompt treba porovnať s baseline na reprezentatívnej golden set a samostatne sledovať kritické chyby, segmenty, stabilitu, cenu a latenciu.

Po prečítaní budete vedieť

  • vytvoriť reprezentatívnu golden set s držanou časťou
  • kombinovať deterministické, ľudské a modelové hodnotenie
  • nastaviť release prahy, monitoring a regresné testy
Zadarmo po registrácii

Celá kapitola je zadarmo po registrácii.

Jedna pôsobivá odpoveď nie je dôkaz. Prompt treba porovnať s baseline na reprezentatívnej golden set a samostatne sledovať kritické chyby, segmenty, stabilitu, cenu a latenciu.

Prompt nemožno seriózne hodnotiť jednou ukážkou. Jazykové modely pracujú s rôznorodými vstupmi, ich odpovede môžu kolísať a malá zmena modelu, dát či šablóny môže opraviť jednu skupinu prípadov a pokaziť inú. Testovanie promptov preto pripomína produktový experiment aj softvérovú regresiu. Výsledok ovplyvňuje model, prompt, kontext, nástroje, nastavenia, post-processing a vstupné dáta. Ak zmeníte viac vrstiev naraz, neviete, čo spôsobilo rozdiel. Experiment preto eviduje: Pri konverzačnom systéme testujte aj viac kôl, nie iba izolovanú otázku. Zlyhanie sa môže objaviť po oprave používateľa alebo po dlhej histórii. Niektoré chyby majú rozdielnu váhu. Nesprávna čiarka a vymyslená zdravotná rada nemôžu mať rovnaký bodový trest. Kritická chyba môže znamenať automatické nesplnenie release prahu. Sadu rozdeľte na vývojovú a držanú testovaciu časť. Ak prompt stále ladíte na rovnakých dvadsiatich prípadoch, môžete ich „preučiť“ bez zlepšenia v prevádzke. Golden set má vlastníka, verziu a proces dopĺňania. OpenAI opisuje takú sadu ako živú autoritatívnu referenciu pre konkrétny workflow, nie jednorazový benchmark.

Ťažisko tvoria časti „Čo presne testujete“, „Z požiadavky vytvorte metriku“ a „Golden set je živá referenčná sada“. Nejde iba o vysvetlenie pojmov. Kapitola ich prepája s rozhodnutiami, príkladmi a hranicami, ktoré treba poznať pri reálnom použití.

Po prečítaní budete vedieť vytvoriť reprezentatívnu golden set s držanou časťou a kombinovať deterministické, ľudské a modelové hodnotenie. Praktickým výsledkom bude schopnosť nastaviť release prahy, monitoring a regresné testy.

Kapitola odpovedá aj na otázku „Koľko testovacích prípadov stačí?“ Neexistuje univerzálne číslo. Sada musí pokryť bežné vstupy, hranice a všetky chyby s vysokým následkom; dôležitejšie je pokrytie než samotný počet.

22odborných častí
48minút čítania
5odkazov na zdroje
V plnej kapitole nájdete
  1. Čo presne testujete
  2. Z požiadavky vytvorte metriku
  3. Golden set je živá referenčná sada
  4. Referenčná odpoveď nemusí byť jedna veta
  5. Deterministické kontroly použite ako prvé
  6. Ľudské hodnotenie
  7. LLM ako hodnotiteľ
  8. A/B test promptov
Registrovať sa alebo prihlásiť

Prihlásenie zabezpečuje ChatGPT. PoznAI nedostane vaše heslo.

Praktické odpovede

Často kladené otázky

Koľko testovacích prípadov stačí?

Neexistuje univerzálne číslo. Sada musí pokryť bežné vstupy, hranice a všetky chyby s vysokým následkom; dôležitejšie je pokrytie než samotný počet.

Môže prompty hodnotiť iný LLM?

Áno ako škálovateľný signál, ak má jasnú rubriku a je kalibrovaný proti odborníkom. Pri kritickej úlohe nemá byť jedinou release bránou.

Prečo nestačí priemerné skóre?

Priemer môže zakryť regresiu v malej, ale závažnej skupine. Sledujte segmenty a kritické chyby osobitne.