Presná definícia
Čo znamená Q-learning?
Q-learning je off-policy TD algoritmus, ktorý Q-funkciu aktualizuje cieľom r+γ maxa Q(s',a). Učí sa hodnotu optimálnej politiky nezávisle od politiky, ktorá zbiera dáta, ak sú splnené podmienky návštev a krokov učenia.
Skúsenosť a kontext
Ako sa pojem používa v praxi
V tabuľkovom simulátore tím zbiera dáta epsilon-greedy politikou, sleduje návštevy všetkých akcií a výslednú greedy politiku testuje na nových epizódach.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Čo presne znamená Q-learning?
Q-learning je off-policy TD algoritmus, ktorý Q-funkciu aktualizuje cieľom r+γ maxa Q(s',a).
Kedy sa Q-learning používa?
V tabuľkovom simulátore tím zbiera dáta epsilon-greedy politikou, sleduje návštevy všetkých akcií a výslednú greedy politiku testuje na nových epizódach.
Od čoho treba Q-learning odlíšiť?
SARSA používa ďalšiu akciu behaviorálnej politiky; Q-learning v cieli používa maximum a je off-policy.
Ako sa Q-learning kontroluje?
Overuje sa update, terminálna maska, pokrytie stavov a akcií, learning rate, discount, konvergencia a nadhodnotenie.
Aké obmedzenie má Q-learning?
S aproximátorom a off-policy dátami môže byť nestabilný; maximum navyše systematicky zvýrazňuje kladné chyby.
Prihlásiť / registrovať