Slovník výrazov AI/Veľké jazykové modely

Veľké jazykové modely

priama optimalizácia preferencií

Anglický výraz direct preference optimization

špecializovanéheslo č. 4985 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená priama optimalizácia preferencií?

Priama optimalizácia preferencií (DPO) dolaďuje jazykový model z dvojíc preferovanej a odmietnutej odpovede pomocou klasifikačného cieľa odvodeného z KL-regularizovaného RLHF. V základnom postupe nepotrebuje samostatne vytrénovaný model odmeny ani vzorkovanie politiky počas optimalizácie; porovnáva log-pravdepodobnosti politiky s referenčným modelom.

Skúsenosť a kontext

Ako sa pojem používa v praxi

DPO sa používa, keď má tím kvalitné preferenčné páry a chce jednoduchší offline tréning než PPO-based RLHF. Dáta sa delia podľa promptu, vyvažujú sa typy preferencií a parameter beta sa ladí proti odklonu od referencie. Nezávislé ľudské a bezpečnostné evaly zostávajú potrebné, pretože nízka tréningová strata môže iba kopírovať annotátorov.

Overiteľnosť

Odborné zdroje

  1. Direct Preference Optimizationarxiv.org
  2. Training Language Models to Follow Instructions with Human Feedbackarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje priama optimalizácia preferencií?

Cieľ zvyšuje rozdiel relatívnych log-pravdepodobností medzi zvolenou a odmietnutou odpoveďou oproti referenčnej politike.

Kedy má priama optimalizácia preferencií praktický význam?

DPO sa používa, keď má tím kvalitné preferenčné páry a chce jednoduchší offline tréning než PPO-based RLHF.

S čím si pojem nezamieňať?

RLHF s modelom odmeny explicitne odhaduje skalárnu odmenu a optimalizuje ju; DPO túto dvojicu krokov nahrádza priamou preferenčnou stratou.

Ako sa výsledok kontroluje?

Meria sa presnosť na preferenčných pároch, ľudská win rate, KL odklon, faktickosť, dĺžkový bias a výsledky bezpečnostných testov.

Na čo si dať pozor?

Preferencie môžu odrážať povrchný štýl alebo dĺžku; distribučný posun promptov a príliš vysoké beta nastavenie zhoršia generalizáciu.