epsilon-greedy 戦略で CliffWalking を解く
CliffWalking 環境は、RL アルゴリズムの標準的なテストベッドです。これはグリッドワールドで、エージェントはスタートからゴールまで崖を避けて進む経路を見つけます。epsilon-greedy 戦略を使うと、エージェントは探索を進めながら崖を避ける行動を学習でき、累積報酬を最大化できます。あなたの課題は、この環境を epsilon-greedy 戦略で解き、各学習エピソードで得られた報酬を計算し、rewards_eps_greedy リストに保存することです。
この演習はコースの一部です
Pythonで学ぶGymnasiumによるReinforcement Learning
演習の手順
- 各エピソード内で、
epsilon_greedy()関数を使ってactionを選択します。 - 受け取った
rewardをepisode_rewardに加算します。 - 各エピソード終了後、合計の
episode_rewardを後で分析できるようrewards_eps_greedyリストに追加します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
rewards_eps_greedy = []
for episode in range(total_episodes):
state, info = env.reset()
episode_reward = 0
for i in range(max_steps):
# Select action with epsilon-greedy strategy
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
# Accumulate reward
____
update_q_table(state, action, reward, next_state)
state = next_state
# Append the toal reward to the rewards list
____
print("Average reward per episode: ", np.mean(rewards_eps_greedy))