环境与神经网络设置
您将首先设置本课程中要使用的环境:Lunar Lander 环境。在该环境中,智能体需要控制飞船的推进器,使其在月球上着陆。
torch、torch.nn、torch.optim 和 gym 已为本练习导入。
本练习是课程的一部分
Python 中的深度强化学习
练习说明
- 在
gym中初始化 Lunar Lander 环境(LunarLander-v2)。 - 定义一个线性变换层,输入维度为
dim_inputs,输出维度为dim_outputs。 - 实例化神经网络,输入维度为
8,输出维度为4。 - 将网络参数提供给 Adam 优化器。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Initiate the Lunar Lander environment
env = gym.____
class Network(nn.Module):
def __init__(self, dim_inputs, dim_outputs):
super(Network, self).__init__()
# Define a linear transformation layer
self.linear = ____
def forward(self, x):
return self.linear(x)
# Instantiate the network
network = ____
# Initialize the optimizer
optimizer = optim.Adam(____, lr=0.0001)
print("Network initialized as:\n", network)