Slovník výrazov AI/Posilňované učenie

Posilňované učenie

optimalizácia politiky s oblasťou dôvery

Anglický výraz trust region policy optimization

špecializovanéheslo č. 12915 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená optimalizácia politiky s oblasťou dôvery?

Optimalizácia politiky s oblasťou dôvery maximalizuje lokálny surrogate cieľ pri obmedzení priemernej KL divergencie medzi starou a novou politikou. Druhoradová aproximácia má zabrániť kroku, ktorý by znehodnotil lokálny odhad zlepšenia.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Pri tréningu tím overí backtracking line search, skutočnú KL a zlepšenie surrogate po každom kroku. Politiku hodnotí na nezávislých trajektóriách.

Overiteľnosť

Odborné zdroje

  1. Schulman et al. - Trust Region Policy Optimizationproceedings.mlr.press
  2. OpenAI - Spinning Up in Deep Reinforcement Learningspinningup.openai.com

Praktické odpovede

Často kladené otázky

Čo presne znamená optimalizácia politiky s oblasťou dôvery?

Optimalizácia politiky s oblasťou dôvery maximalizuje lokálny surrogate cieľ pri obmedzení priemernej KL divergencie medzi starou a novou politikou.

Kedy sa optimalizácia politiky s oblasťou dôvery používa?

Pri tréningu tím overí backtracking line search, skutočnú KL a zlepšenie surrogate po každom kroku.

Od čoho treba optimalizácia politiky s oblasťou dôvery odlíšiť?

PPO približuje konzervatívnu zmenu clippingom; TRPO explicitne rieši trust-region obmedzenie.

Ako sa optimalizácia politiky s oblasťou dôvery kontroluje?

Kontroluje sa Fisher-vector product, conjugate gradient, line search, KL limit, advantage a on-policy zber dát.

Aké obmedzenie má optimalizácia politiky s oblasťou dôvery?

Výpočet je zložitejší a teoretická monotónnosť sa oslabí pri aproximácii funkcie a konečných vzorkách.