始める無料で始める

epsilon-greedy 戦略で CliffWalking を解く

CliffWalking 環境は、RL アルゴリズムの標準的なテストベッドです。これはグリッドワールドで、エージェントはスタートからゴールまで崖を避けて進む経路を見つけます。epsilon-greedy 戦略を使うと、エージェントは探索を進めながら崖を避ける行動を学習でき、累積報酬を最大化できます。あなたの課題は、この環境を epsilon-greedy 戦略で解き、各学習エピソードで得られた報酬を計算し、rewards_eps_greedy リストに保存することです。

この演習はコースの一部です

Pythonで学ぶGymnasiumによるReinforcement Learning

コースを見る

演習の手順

  • 各エピソード内で、epsilon_greedy() 関数を使って action を選択します。
  • 受け取った rewardepisode_reward に加算します。
  • 各エピソード終了後、合計の episode_reward を後で分析できるよう rewards_eps_greedy リストに追加します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

rewards_eps_greedy = []
for episode in range(total_episodes):
    state, info = env.reset()
    episode_reward = 0
    for i in range(max_steps):
      	# Select action with epsilon-greedy strategy
        action = ____
        next_state, reward, terminated, truncated, info = env.step(action)
        # Accumulate reward
        ____        
        update_q_table(state, action, reward, next_state)      
        state = next_state
    # Append the toal reward to the rewards list 
    ____
print("Average reward per episode: ", np.mean(rewards_eps_greedy))
コードを編集して実行