开始使用免费开始使用

环境与神经网络设置

您将首先设置本课程中要使用的环境:Lunar Lander 环境。在该环境中,智能体需要控制飞船的推进器,使其在月球上着陆。

torchtorch.nntorch.optimgym 已为本练习导入。

本练习是课程的一部分

Python 中的深度强化学习

查看课程

练习说明

  • gym 中初始化 Lunar Lander 环境(LunarLander-v2)。
  • 定义一个线性变换层,输入维度为 dim_inputs,输出维度为 dim_outputs
  • 实例化神经网络,输入维度为 8,输出维度为 4
  • 将网络参数提供给 Adam 优化器。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Initiate the Lunar Lander environment
env = gym.____

class Network(nn.Module):
    def __init__(self, dim_inputs, dim_outputs):
        super(Network, self).__init__()
        # Define a linear transformation layer 
        self.linear = ____
    def forward(self, x):
        return self.linear(x)

# Instantiate the network
network = ____

# Initialize the optimizer
optimizer = optim.Adam(____, lr=0.0001)

print("Network initialized as:\n", network)
编辑并运行代码