शुरू करेंमुफ़्त में शुरू करें

A2C एल्गोरिदम को ट्रेन करना

अब A2C एल्गोरिदम के साथ अपने Lunar Lander को ट्रेन करने का समय है! आपके पास सारे बिल्डिंग ब्लॉक्स हैं, अब उन्हें साथ में जोड़ना है.

Actor और critic नेटवर्क actor और critic के रूप में बनाए जा चुके हैं, और उनके optimizers actor_optimizer और critic_optimizer भी उपलब्ध हैं.

आपकी REINFORCE वाली select_action() फंक्शन और पिछले अभ्यास की calculate_losses() फंक्शन भी यहाँ उपयोग के लिए उपलब्ध हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Deep Reinforcement Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • दिए गए state के आधार पर actor से action चुनवाएँ.
  • Actor और critic दोनों के लिए losses की गणना करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

for episode in range(10):
    state, info = env.reset()
    done = False
    episode_reward = 0
    step = 0
    while not done:
        step += 1
        if done:
            break
        # Select the action
        ____
        next_state, reward, terminated, truncated, _ = env.step(action)
        done = terminated or truncated
        episode_reward += reward
        # Calculate the losses
        ____, ____ = ____(
            critic, action_log_prob, 
            reward, state, next_state, done)        
        actor_optimizer.zero_grad()
        actor_loss.backward()
        actor_optimizer.step()
        critic_optimizer.zero_grad()
        critic_loss.backward()
        critic_optimizer.step()
        state = next_state
    describe_episode(episode, reward, episode_reward, step)
कोड संपादित करें और चलाएँ