Slovník výrazov AI/Posilňované učenie

Posilňované učenie

Bellmanova rovnica optimality

Anglický výraz Bellman optimality equation

základnéheslo č. 12655 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená Bellmanova rovnica optimality?

Bellmanova rovnica optimality charakterizuje optimálnu hodnotu tým, že po každom prechode vyberá najlepšiu dostupnú ďalšiu akciu. Je nelineárnym pevným bodom, z ktorého možno odvodiť optimálnu greedy politiku.

Skúsenosť a kontext

Ako sa pojem používa v praxi

V malom diskrétnom MDP tím iteruje operátor optimality do konvergencie a výslednú politiku overí simuláciou aj citlivosťou na chyby prechodov.

Overiteľnosť

Odborné zdroje

  1. Sutton & Barto - Reinforcement Learning: An Introductionandrew.cmu.edu
  2. OpenAI - Spinning Up in Deep Reinforcement Learningspinningup.openai.com

Praktické odpovede

Často kladené otázky

Čo presne znamená Bellmanova rovnica optimality?

Bellmanova rovnica optimality charakterizuje optimálnu hodnotu tým, že po každom prechode vyberá najlepšiu dostupnú ďalšiu akciu.

Kedy sa Bellmanova rovnica optimality používa?

V malom diskrétnom MDP tím iteruje operátor optimality do konvergencie a výslednú politiku overí simuláciou aj citlivosťou na chyby prechodov.

Od čoho treba Bellmanova rovnica optimality odlíšiť?

Bežná Bellmanova rovnica priemeruje podľa zadanej politiky; verzia optimality používa maximum nad akciami.

Ako sa Bellmanova rovnica optimality kontroluje?

Kontroluje sa úplnosť akcií, prechody, discount, kontrakcia, konvergenčné kritérium a väzby pri rovnakých hodnotách.

Aké obmedzenie má Bellmanova rovnica optimality?

Optimálne riešenie modelu môže byť prevádzkovo zlé, ak model prechodov alebo odmien nezodpovedá realite.