시작하기무료로 시작하기

우선순위 기반 경험 재현을 적용한 DQN

이번 연습 문제에서는 Prioritized Experience Replay(PER)를 도입해 DQN 알고리즘을 개선해 보겠습니다. PER의 목적은 각 단계에서 네트워크를 업데이트할 때 선택되는 전이 배치의 품질을 최적화하는 것입니다.

참고로, PrioritizedReplayBuffer에 대해 선언해 둔 메서드 이름은 다음과 같습니다.

  • push() (전이를 버퍼에 추가)
  • sample() (버퍼에서 전이 배치를 샘플링)
  • increase_beta() (중요도 샘플링을 점진적으로 강화)
  • update_priorities() (샘플링된 항목의 우선순위 업데이트)

각 에피소드를 설명하기 위해 describe_episode() 함수를 다시 사용합니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Deep Reinforcement Learning

강의 보기

연습 안내

  • 전이 10000개 용량의 Prioritized Experience Replay 버퍼를 인스턴스화하세요.
  • 시간 경과에 따라 beta 매개변수를 업데이트해 중요도 샘플링의 영향력을 높이세요.
  • 최신 TD 오류를 기준으로 샘플링된 경험의 우선순위를 업데이트하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Instantiate a Prioritized Replay Buffer with capacity 10000
replay_buffer = ____(____)

for episode in range(5):
    state, info = env.reset()
    done = False   
    step = 0
    episode_reward = 0    
    # Increase the replay buffer's beta parameter
    replay_buffer.____
    while not done:
        step += 1
        total_steps += 1
        q_values = online_network(state)
        action = select_action(q_values, total_steps, start=.9, end=.05, decay=1000)
        next_state, reward, terminated, truncated, _ = env.step(action)
        done = terminated or truncated
        replay_buffer.push(state, action, reward, next_state, done)        
        if len(replay_buffer) >= batch_size:
            states, actions, rewards, next_states, dones, indices, weights = replay_buffer.sample(64)
            q_values = online_network(states).gather(1, actions).squeeze(1)
            with torch.no_grad():
                next_q_values = target_network(next_states).amax(1)
                target_q_values = rewards + gamma * next_q_values * (1-dones)            
            td_errors = target_q_values - q_values
            # Update the replay buffer priorities for that batch
            replay_buffer.____(____, ____)
            loss = torch.sum(weights * (q_values - target_q_values) ** 2)
            optimizer.zero_grad()
            loss.backward()
            optimizer.step()
            update_target_network(target_network, online_network, tau=.005)
        state = next_state
        episode_reward += reward    
    describe_episode(episode, reward, episode_reward, step)
코드 편집 및 실행