Tworzenie instancji sieci Q
Skoro architektura sieci jest już zdefiniowana, możesz przystąpić do stworzenia właściwej sieci, której agent będzie używał – wraz z jej optymalizatorem. Środowisko Lunar Lander ma przestrzeń stanów o wymiarze 8 oraz przestrzeń akcji o wymiarze 4 (odpowiadające: 0: do nothing, 1: left thruster, 2: main engine, 3: right thruster).
Klasa QNetwork z poprzedniego ćwiczenia jest już dla ciebie dostępna.
To ćwiczenie jest częścią kursu
Głębokie uczenie ze wzmocnieniem w Pythonie
Instrukcje do ćwiczenia
- Utwórz instancję sieci Q dla środowiska Lunar Lander.
- Zdefiniuj optymalizator Adam dla sieci neuronowej, ustawiając współczynnik uczenia na 0.0001.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
state_size = 8
action_size = 4
# Instantiate the Q Network
q_network = QNetwork(____, ____)
# Specify the optimizer learning rate
optimizer = optim.Adam(q_network.parameters(), ____)
print("Q-Network initialized as:\n", q_network)