Vytvoření instance Q-Network
Teď, když máš architekturu definovanou, můžeš vytvořit samotnou síť, kterou bude tvůj agent používat, a nastavit k ní optimalizátor. Prostředí Lunar Lander má stavový prostor o dimenzi 8 a akční prostor o dimenzi 4 (odpovídající akcím 0: do nothing, 1: left thruster, 2: main engine, 3: right thruster).
Třída QNetwork z předchozího cvičení je k dispozici.
Toto cvičení je součástí kurzu
Deep Reinforcement Learning v Pythonu
Pokyny k cvičení
- Vytvoř instanci Q-Network pro prostředí Lunar Lander.
- Definuj optimalizátor Adam pro neuronovou síť a nastav rychlost učení na 0.0001.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
state_size = 8
action_size = 4
# Instantiate the Q Network
q_network = QNetwork(____, ____)
# Specify the optimizer learning rate
optimizer = optim.Adam(q_network.parameters(), ____)
print("Q-Network initialized as:\n", q_network)