Slovník výrazov AI/Posilňované učenie

Posilňované učenie

optimalizácia blízkej politiky

Anglický výraz proximal policy optimization

pokročiléheslo č. 12905 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená optimalizácia blízkej politiky?

Optimalizácia blízkej politiky je on-policy actor-critic metóda, ktorá obmedzuje priveľké zmeny politiky orezaným surrogate cieľom alebo KL penalizáciou. Prakticky umožňuje viac aktualizácií z jednej dávky pri kontrolovanom pomere pravdepodobností.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Tím sleduje clipping fraction, približnú KL, entropiu, value loss a návratnosť. Aktualizáciu zastaví, ak KL prekročí vopred určenú hranicu.

Overiteľnosť

Odborné zdroje

  1. Schulman et al. - Proximal Policy Optimization Algorithmsarxiv.org
  2. OpenAI - Spinning Up in Deep Reinforcement Learningspinningup.openai.com

Praktické odpovede

Často kladené otázky

Čo presne znamená optimalizácia blízkej politiky?

Optimalizácia blízkej politiky je on-policy actor-critic metóda, ktorá obmedzuje priveľké zmeny politiky orezaným surrogate cieľom alebo KL penalizáciou.

Kedy sa optimalizácia blízkej politiky používa?

Tím sleduje clipping fraction, približnú KL, entropiu, value loss a návratnosť.

Od čoho treba optimalizácia blízkej politiky odlíšiť?

TRPO rieši explicitné constrained optimum s trust region; PPO používa jednoduchší clipped alebo penalizovaný cieľ.

Ako sa optimalizácia blízkej politiky kontroluje?

Overuje sa probability ratio, staré log-probabilities, advantage, clip range, počet epoch, KL a on-policy čerstvosť dát.

Aké obmedzenie má optimalizácia blízkej politiky?

PPO nie je automaticky stabilná: opakované epochy, slabý kritik alebo zlá škála odmeny môžu politiku poškodiť.