Instanțierea rețelei Q
Acum că i-ai definit arhitectura, ești pregătit să instanțiezi rețeaua pe care agentul tău o va folosi, împreună cu optimizatorul acesteia. Mediul Lunar Lander are un spațiu de stări de dimensiune 8 și un spațiu de acțiuni de dimensiune 4 (corespunzând valorilor 0: do nothing, 1: left thruster, 2: main engine, 3: right thruster).
Clasa QNetwork din exercițiul anterior îți este disponibilă.
Acest exercițiu face parte din cursul
Deep Reinforcement Learning în Python
Instrucțiuni pentru exercițiu
- Instanțiază o rețea Q pentru mediul Lunar Lander.
- Definește optimizatorul Adam pentru rețeaua neuronală, specificând o rată de învățare de 0,0001.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
state_size = 8
action_size = 4
# Instantiate the Q Network
q_network = QNetwork(____, ____)
# Specify the optimizer learning rate
optimizer = optim.Adam(q_network.parameters(), ____)
print("Q-Network initialized as:\n", q_network)