Slovník výrazov AI/Posilňované učenie

Posilňované učenie

iterácia politiky

Anglický výraz policy iteration

základnéheslo č. 12685 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená iterácia politiky?

Iterácia politiky opakovane strieda vyhodnotenie aktuálnej politiky a jej zlepšenie podľa získanej hodnotovej funkcie. V konečnom diskontovanom MDP pri presných krokoch dospeje k optimálnej politike.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Pri malom plánovacom modeli tím presne vyhodnotí politiku, urobí greedy update a cyklus opakuje do stability. Výsledok preverí v scenároch s neistými prechodmi.

Overiteľnosť

Odborné zdroje

  1. Sutton & Barto - Reinforcement Learning: An Introductionandrew.cmu.edu
  2. OpenAI - Spinning Up in Deep Reinforcement Learningspinningup.openai.com

Praktické odpovede

Často kladené otázky

Čo presne znamená iterácia politiky?

Iterácia politiky opakovane strieda vyhodnotenie aktuálnej politiky a jej zlepšenie podľa získanej hodnotovej funkcie.

Kedy sa iterácia politiky používa?

Pri malom plánovacom modeli tím presne vyhodnotí politiku, urobí greedy update a cyklus opakuje do stability.

Od čoho treba iterácia politiky odlíšiť?

Value iteration skracuje hodnotenie na aktualizácie optimálneho operátora; policy iteration explicitne udržiava a hodnotí politiku.

Ako sa iterácia politiky kontroluje?

Kontroluje sa konvergencia hodnotenia, zmena politiky, ties, diskont, terminálne stavy a numerická tolerancia.

Aké obmedzenie má iterácia politiky?

Pri približnom hodnotení vo veľkom priestore sa zlepšenie nemusí zachovať a iterácie môžu oscilovať.