始める無料で始める

Q-Network のインスタンス化

ネットワークのアーキテクチャを定義できたので、エージェントが実際に使用するネットワーク本体と、そのオプティマイザを作成します。Lunar Lander 環境の状態空間の次元は 8、行動空間の次元は 4 です(0: 何もしない1: 左スラスター2: メインエンジン3: 右スラスター に対応)。

前の演習で作成した QNetwork クラスが利用できます。

この演習はコースの一部です

Pythonで学ぶDeep Reinforcement Learning

コースを見る

演習の手順

  • Lunar Lander 環境向けに Q Network をインスタンス化します。
  • ニューラルネットワーク用に Adam オプティマイザを定義し、学習率 0.0001 を指定します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

state_size = 8
action_size = 4
# Instantiate the Q Network
q_network = QNetwork(____, ____)
# Specify the optimizer learning rate
optimizer = optim.Adam(q_network.parameters(), ____)

print("Q-Network initialized as:\n", q_network)
コードを編集して実行