开始使用免费开始使用

实例化 Q-Network

现在您已经定义好了网络结构,接下来要实例化智能体实际使用的网络及其优化器。Lunar Lander 环境的状态空间维度为 8,动作空间维度为 4(对应 0: do nothing1: left thruster2: main engine3: right thruster)。

上一练习中的 QNetwork 类已为您提供。

本练习是课程的一部分

Python 中的深度强化学习

查看课程

练习说明

  • 为 Lunar Lander 环境实例化一个 Q 网络。
  • 为该神经网络定义 Adam 优化器,并将学习率设为 0.0001。

交互式实操练习

通过完成这段示例代码来试试这个练习。

state_size = 8
action_size = 4
# Instantiate the Q Network
q_network = QNetwork(____, ____)
# Specify the optimizer learning rate
optimizer = optim.Adam(q_network.parameters(), ____)

print("Q-Network initialized as:\n", q_network)
编辑并运行代码