Slovník výrazov AI/Veľké jazykové modely

Veľké jazykové modely

posilňované učenie z ľudskej spätnej väzby

Anglický výraz reinforcement learning from human feedback

špecializovanéheslo č. 4975 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená posilňované učenie z ľudskej spätnej väzby?

Posilňované učenie z ľudskej spätnej väzby (RLHF) prispôsobuje politiku modelu preferenciám získaným od ľudí. Typický postup vytrénuje model odmeny z porovnaní odpovedí a potom optimalizuje jazykový model na túto odmenu s penalizáciou odklonu od referenčnej politiky. Ľudská spätná väzba sa tak mení na aproximovaný cieľ, nie na úplnú definíciu správnosti.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Používa sa na zlepšenie užitočnosti, nasledovania pokynov a vybraných bezpečnostných vlastností asistenta. Program potrebuje jasné pravidlá anotácie, viac hodnotiteľov, kontrolu zhody a evaly mimo odmeňovacieho modelu. Sleduje sa aj reward hacking, nadmerné odmietanie a rozdiely medzi skupinami používateľov.

Overiteľnosť

Odborné zdroje

  1. Training Language Models to Follow Instructions with Human Feedbackarxiv.org
  2. Direct Preference Optimizationarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje posilňované učenie z ľudskej spätnej väzby?

Preferenčné páry naučia skalárny model odmeny; algoritmus posilňovaného učenia zvyšuje očakávanú odmenu a KL člen bráni prudkému odklonu.

Kedy má posilňované učenie z ľudskej spätnej väzby praktický význam?

Používa sa na zlepšenie užitočnosti, nasledovania pokynov a vybraných bezpečnostných vlastností asistenta.

S čím si pojem nezamieňať?

DPO optimalizuje preferenčné páry priamo bez samostatného explicitného modelu odmeny a online RL slučky v základnej formulácii.

Ako sa výsledok kontroluje?

Kontroluje sa ľudské porovnanie na nezadržaných promptoch, zhoda hodnotiteľov, distribúcia odmien, KL odklon a adversariálne evaly.

Na čo si dať pozor?

Model môže využívať slabinu odmeny, učiť sa preferencie úzkej skupiny alebo pôsobiť prívetivo na úkor pravdivosti.