计算 Q 值
您的目标是为自定义环境 MyGridWorld 中的每个状态-动作对计算动作价值(也称 Q 值),前提是遵循下方策略。在强化学习中,Q 值非常关键,因为它表示在给定状态下执行特定动作、并继续遵循该策略时的期望效用。

环境已作为 env 导入,同时还提供了 compute_state_value() 函数和所需的变量(terminal_state、num_states、num_actions、policy、gamma)。
本练习是课程的一部分
Python 中的 Gymnasium 强化学习
练习说明
- 完成
compute_q_value()函数,以计算给定state和action的动作价值。 - 创建字典
Q,其中每个键表示一个状态-动作对,对应的值为该对的 Q 值。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
if state == terminal_state:
return None
probability, next_state, reward, done = ____
return ____
# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}
print(Q)