Q-Network のインスタンス化
ネットワークのアーキテクチャを定義できたので、エージェントが実際に使用するネットワーク本体と、そのオプティマイザを作成します。Lunar Lander 環境の状態空間の次元は 8、行動空間の次元は 4 です(0: 何もしない、1: 左スラスター、2: メインエンジン、3: 右スラスター に対応)。
前の演習で作成した QNetwork クラスが利用できます。
この演習はコースの一部です
Pythonで学ぶDeep Reinforcement Learning
演習の手順
- Lunar Lander 環境向けに Q Network をインスタンス化します。
- ニューラルネットワーク用に Adam オプティマイザを定義し、学習率 0.0001 を指定します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
state_size = 8
action_size = 4
# Instantiate the Q Network
q_network = QNetwork(____, ____)
# Specify the optimizer learning rate
optimizer = optim.Adam(q_network.parameters(), ____)
print("Q-Network initialized as:\n", q_network)