Presná definícia
Čo znamená priama optimalizácia preferencií?
Priama optimalizácia preferencií (DPO) dolaďuje jazykový model z dvojíc preferovanej a odmietnutej odpovede pomocou klasifikačného cieľa odvodeného z KL-regularizovaného RLHF. V základnom postupe nepotrebuje samostatne vytrénovaný model odmeny ani vzorkovanie politiky počas optimalizácie; porovnáva log-pravdepodobnosti politiky s referenčným modelom.
Skúsenosť a kontext
Ako sa pojem používa v praxi
DPO sa používa, keď má tím kvalitné preferenčné páry a chce jednoduchší offline tréning než PPO-based RLHF. Dáta sa delia podľa promptu, vyvažujú sa typy preferencií a parameter beta sa ladí proti odklonu od referencie. Nezávislé ľudské a bezpečnostné evaly zostávajú potrebné, pretože nízka tréningová strata môže iba kopírovať annotátorov.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Ako funguje priama optimalizácia preferencií?
Cieľ zvyšuje rozdiel relatívnych log-pravdepodobností medzi zvolenou a odmietnutou odpoveďou oproti referenčnej politike.
Kedy má priama optimalizácia preferencií praktický význam?
DPO sa používa, keď má tím kvalitné preferenčné páry a chce jednoduchší offline tréning než PPO-based RLHF.
S čím si pojem nezamieňať?
RLHF s modelom odmeny explicitne odhaduje skalárnu odmenu a optimalizuje ju; DPO túto dvojicu krokov nahrádza priamou preferenčnou stratou.
Ako sa výsledok kontroluje?
Meria sa presnosť na preferenčných pároch, ľudská win rate, KL odklon, faktickosť, dĺžkový bias a výsledky bezpečnostných testov.
Na čo si dať pozor?
Preferencie môžu odrážať povrchný štýl alebo dĺžku; distribučný posun promptov a príliš vysoké beta nastavenie zhoršia generalizáciu.
Prihlásiť / registrovať