Slovník výrazov AI/Posilňované učenie

Posilňované učenie

Q-learning

Anglický výraz Q-learning

pokročiléheslo č. 12725 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená Q-learning?

Q-learning je off-policy TD algoritmus, ktorý Q-funkciu aktualizuje cieľom r+γ maxa Q(s',a). Učí sa hodnotu optimálnej politiky nezávisle od politiky, ktorá zbiera dáta, ak sú splnené podmienky návštev a krokov učenia.

Skúsenosť a kontext

Ako sa pojem používa v praxi

V tabuľkovom simulátore tím zbiera dáta epsilon-greedy politikou, sleduje návštevy všetkých akcií a výslednú greedy politiku testuje na nových epizódach.

Overiteľnosť

Odborné zdroje

  1. Sutton & Barto - Reinforcement Learning: An Introductionandrew.cmu.edu
  2. Mnih et al. - Human-level control through deep reinforcement learningdoi.org

Praktické odpovede

Často kladené otázky

Čo presne znamená Q-learning?

Q-learning je off-policy TD algoritmus, ktorý Q-funkciu aktualizuje cieľom r+γ maxa Q(s',a).

Kedy sa Q-learning používa?

V tabuľkovom simulátore tím zbiera dáta epsilon-greedy politikou, sleduje návštevy všetkých akcií a výslednú greedy politiku testuje na nových epizódach.

Od čoho treba Q-learning odlíšiť?

SARSA používa ďalšiu akciu behaviorálnej politiky; Q-learning v cieli používa maximum a je off-policy.

Ako sa Q-learning kontroluje?

Overuje sa update, terminálna maska, pokrytie stavov a akcií, learning rate, discount, konvergencia a nadhodnotenie.

Aké obmedzenie má Q-learning?

S aproximátorom a off-policy dátami môže byť nestabilný; maximum navyše systematicky zvýrazňuje kladné chyby.