環境とニューラルネットワークのセットアップ
このコースを通して使用する環境をまずはセットアップします。Lunar Lander 環境では、エージェントがスラスターを制御して月面着陸を目指します。
torch、torch.nn、torch.optim、gym は演習内でインポート済みです。
この演習はコースの一部です
Pythonで学ぶDeep Reinforcement Learning
演習の手順
gymで Lunar Lander 環境(LunarLander-v2)を初期化します。- 入力次元を
dim_inputs、出力次元をdim_outputsとする単一の線形変換レイヤーを定義します。 - 入力次元
8、出力次元4でニューラルネットワークを作成します。 - Adam オプティマイザにパラメータを渡します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Initiate the Lunar Lander environment
env = gym.____
class Network(nn.Module):
def __init__(self, dim_inputs, dim_outputs):
super(Network, self).__init__()
# Define a linear transformation layer
self.linear = ____
def forward(self, x):
return self.linear(x)
# Instantiate the network
network = ____
# Initialize the optimizer
optimizer = optim.Adam(____, lr=0.0001)
print("Network initialized as:\n", network)