Presná definícia
Čo znamená posilňované učenie z ľudskej spätnej väzby?
Posilňované učenie z ľudskej spätnej väzby (RLHF) prispôsobuje politiku modelu preferenciám získaným od ľudí. Typický postup vytrénuje model odmeny z porovnaní odpovedí a potom optimalizuje jazykový model na túto odmenu s penalizáciou odklonu od referenčnej politiky. Ľudská spätná väzba sa tak mení na aproximovaný cieľ, nie na úplnú definíciu správnosti.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Používa sa na zlepšenie užitočnosti, nasledovania pokynov a vybraných bezpečnostných vlastností asistenta. Program potrebuje jasné pravidlá anotácie, viac hodnotiteľov, kontrolu zhody a evaly mimo odmeňovacieho modelu. Sleduje sa aj reward hacking, nadmerné odmietanie a rozdiely medzi skupinami používateľov.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Ako funguje posilňované učenie z ľudskej spätnej väzby?
Preferenčné páry naučia skalárny model odmeny; algoritmus posilňovaného učenia zvyšuje očakávanú odmenu a KL člen bráni prudkému odklonu.
Kedy má posilňované učenie z ľudskej spätnej väzby praktický význam?
Používa sa na zlepšenie užitočnosti, nasledovania pokynov a vybraných bezpečnostných vlastností asistenta.
S čím si pojem nezamieňať?
DPO optimalizuje preferenčné páry priamo bez samostatného explicitného modelu odmeny a online RL slučky v základnej formulácii.
Ako sa výsledok kontroluje?
Kontroluje sa ľudské porovnanie na nezadržaných promptoch, zhoda hodnotiteľov, distribúcia odmien, KL odklon a adversariálne evaly.
Na čo si dať pozor?
Model môže využívať slabinu odmeny, učiť sa preferencie úzkej skupiny alebo pôsobiť prívetivo na úkor pravdivosti.
Prihlásiť / registrovať