시작하기무료로 시작하기

Double DQN 학습

이제 DQN 코드를 수정해 Double DQN을 구현해 보겠습니다.

Double DQN은 DQN 알고리즘에 아주 작은 수정만 필요하지만, Q-value 과대평가 문제를 해결하는 데 큰 도움을 주며 종종 DQN보다 더 좋은 성능을 보입니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Deep Reinforcement Learning

강의 보기

연습 안내

  • Q-target 계산을 위해 online_network()를 사용해 다음 행동을 계산하고, 올바른 행동과 텐서 형태를 얻었는지 확인하세요.
  • target_network()로 해당 행동의 Q-value를 추정하고, 역시 올바른 값과 텐서 형태를 얻었는지 확인하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

for episode in range(10):
    state, info = env.reset()
    done = False
    step = 0
    episode_reward = 0
    while not done:
        step += 1
        total_steps += 1
        q_values = online_network(state)
        action = select_action(q_values, total_steps, start=.9, end=.05, decay=1000)
        next_state, reward, terminated, truncated, _ = env.step(action)
        done = terminated or truncated
        replay_buffer.push(state, action, reward, next_state, done)        
        if len(replay_buffer) >= batch_size:
            states, actions, rewards, next_states, dones = replay_buffer.sample(64)
            q_values = online_network(states).gather(1, actions).squeeze(1)
            with torch.no_grad():
                # Obtain next actions for Q-target calculation
                next_actions = ____.____.____
                # Estimate next Q-values from these actions
                next_q_values = ____.____.____
                target_q_values = rewards + gamma * next_q_values * (1-dones)
            loss = nn.MSELoss()(q_values, target_q_values)
            optimizer.zero_grad()
            loss.backward()
            optimizer.step()
            update_target_network(target_network, online_network, tau=.005)
        state = next_state
        episode_reward += reward    
    describe_episode(episode, reward, episode_reward, step)
코드 편집 및 실행