A2C एल्गोरिदम को ट्रेन करना
अब A2C एल्गोरिदम के साथ अपने Lunar Lander को ट्रेन करने का समय है! आपके पास सारे बिल्डिंग ब्लॉक्स हैं, अब उन्हें साथ में जोड़ना है.
Actor और critic नेटवर्क actor और critic के रूप में बनाए जा चुके हैं, और उनके optimizers actor_optimizer और critic_optimizer भी उपलब्ध हैं.
आपकी REINFORCE वाली select_action() फंक्शन और पिछले अभ्यास की calculate_losses() फंक्शन भी यहाँ उपयोग के लिए उपलब्ध हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Deep Reinforcement Learning
अभ्यास निर्देश
- दिए गए state के आधार पर actor से action चुनवाएँ.
- Actor और critic दोनों के लिए losses की गणना करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
for episode in range(10):
state, info = env.reset()
done = False
episode_reward = 0
step = 0
while not done:
step += 1
if done:
break
# Select the action
____
next_state, reward, terminated, truncated, _ = env.step(action)
done = terminated or truncated
episode_reward += reward
# Calculate the losses
____, ____ = ____(
critic, action_log_prob,
reward, state, next_state, done)
actor_optimizer.zero_grad()
actor_loss.backward()
actor_optimizer.step()
critic_optimizer.zero_grad()
critic_loss.backward()
critic_optimizer.step()
state = next_state
describe_episode(episode, reward, episode_reward, step)