2019-11-30から1日間の記事一覧

2019-11-30

SARSA法による倒立振子 (Ｑ値を見える化)

gymの倒立振子を使って強化学習SARSA法 Q-learningとSARSA法の違い次のアクション(next_action)を学習の前に求める(SARSA法)か、学習の後で決定する(Q-learning)かが違います。先に求めるSARSA法だとε-greedy法によりランダムになる場合が出てきます。むず…

ふたり暮らし

アラフィフ夫婦のフリーランスプラン

2019-11-30から1日間の記事一覧

SARSA法による倒立振子 (Ｑ値を見える化)