开始使用免费开始使用

实现完整的 DQN 算法

终于到这一步了!所有前置环节都已完成;现在您将实现完整的 DQN 算法,并用它来训练一个 Lunar Lander 智能体。这意味着算法不仅会使用经验回放(Experience Replay),还将使用衰减的ε-贪婪(Decayed Epsilon-Greediness)和固定 Q 目标(Fixed Q-Targets)。

已为您提供实现了衰减ε-贪婪策略的 select_action() 函数,以及上一练习中的 update_target_network() 函数。接下来只需把这些函数放入 DQN 的训练循环中,并确保在计算损失时正确使用目标网络。

您需要维护一个新的步数计数器 total_steps,用于随时间衰减 ε 的取值。该变量已为您初始化为 0。

本练习是课程的一部分

Python 中的深度强化学习

查看课程

练习说明

  • 使用 select_action() 实现衰减ε-贪婪并选择智能体的动作;您需要使用跨回合累计的 total_steps
  • 在计算 TD 目标之前,先关闭梯度跟踪。
  • 获得下一状态后,获取该下一状态的 Q 值。
  • 在每一步结束时更新目标网络。

交互式实操练习

通过完成这段示例代码来试试这个练习。

for episode in range(10):
    state, info = env.reset()
    done = False
    step = 0
    episode_reward = 0
    while not done:
        step += 1
        total_steps += 1
        q_values = online_network(state)
        # Select the action with epsilon greediness
        action = ____(____, ____, start=.9, end=.05, decay=1000)
        next_state, reward, terminated, truncated, _ = env.step(action)
        done = terminated or truncated
        replay_buffer.push(state, action, reward, next_state, done)        
        if len(replay_buffer) >= batch_size:
            states, actions, rewards, next_states, dones = replay_buffer.sample(64)
            q_values = online_network(states).gather(1, actions).squeeze(1)
            # Ensure gradients are not tracked
            with ____:
                # Obtain the next state Q-values
                next_q_values = ____(next_states).amax(1)
                target_q_values = rewards + gamma * next_q_values * (1-dones)
            loss = nn.MSELoss()(q_values, target_q_values)
            optimizer.zero_grad()
            loss.backward()
            optimizer.step()   
            # Update the target network weights
            ____(____, ____, tau=.005)
        state = next_state
        episode_reward += reward    
    describe_episode(episode, reward, episode_reward, step)
编辑并运行代码