开始使用免费开始使用

定义一个确定性策略

在本练习中,您将使用一个名为 MyGridWorld 的自定义环境(与视频中相同)。这是一个网格世界,智能体的目标是尽快到达钻石。您的任务是按照下图所示为智能体定义一个指导其行为的策略。

Image showing the policy: 
states 0, 1, 6, 7 - action right. 
states 2, 3 - action down. 
states 4, 5 - action left.

动作表示为: (0 → 向左,1 → 向下,2 → 向右,3 → 向上)。

已为您导入 gymnasium 库为 gym,并提供了 render() 函数。

本练习是课程的一部分

Python 中的 Gymnasium 强化学习

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create the environment
env = ____
state, info = env.reset()

# Define the policy
policy = ____
编辑并运行代码