开始使用免费开始使用

计算 Q 值

您的目标是为自定义环境 MyGridWorld 中的每个状态-动作对计算动作价值(也称 Q 值),前提是遵循下方策略。在强化学习中,Q 值非常关键,因为它表示在给定状态下执行特定动作、并继续遵循该策略时的期望效用。

exercise_policy.png

环境已作为 env 导入,同时还提供了 compute_state_value() 函数和所需的变量(terminal_statenum_statesnum_actionspolicygamma)。

本练习是课程的一部分

Python 中的 Gymnasium 强化学习

查看课程

练习说明

  • 完成 compute_q_value() 函数,以计算给定 stateaction 的动作价值。
  • 创建字典 Q,其中每个键表示一个状态-动作对,对应的值为该对的 Q 值。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
    if state == terminal_state:
        return None   
    probability, next_state, reward, done = ____
    return ____

# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}

print(Q)
编辑并运行代码