实例化 Q-Network
现在您已经定义好了网络结构,接下来要实例化智能体实际使用的网络及其优化器。Lunar Lander 环境的状态空间维度为 8,动作空间维度为 4(对应 0: do nothing、1: left thruster、2: main engine、3: right thruster)。
上一练习中的 QNetwork 类已为您提供。
本练习是课程的一部分
Python 中的深度强化学习
练习说明
- 为 Lunar Lander 环境实例化一个 Q 网络。
- 为该神经网络定义 Adam 优化器,并将学习率设为 0.0001。
交互式实操练习
通过完成这段示例代码来试试这个练习。
state_size = 8
action_size = 4
# Instantiate the Q Network
q_network = QNetwork(____, ____)
# Specify the optimizer learning rate
optimizer = optim.Adam(q_network.parameters(), ____)
print("Q-Network initialized as:\n", q_network)