or
이 연습은 강의의 일부입니다
Deep Reinforcement Learning이 전통적인 Reinforcement Learning을 어떻게 발전시키는지 알아보고, 첫 번째 Deep Q Learning 알고리즘을 학습하고 구현해 보세요.
현재 연습
Experience Replay, epsilon-greedy, 고정 Q-targets를 갖춘 원조 DQN 알고리즘을 구현하며 Deep Q-learning을 깊이 있게 다룹니다. 이어서 Deep Q-learning의 성능과 안정성을 개선하는 두 가지 흥미로운 확장 기법인 Double DQN과 Prioritized Experience Replay를 살펴봅니다.
DRL에서 사용되는 정책 경사(policy gradient) 방법의 핵심 개념을 학습합니다. 이 방법들의 토대가 되는 정책 경사 정리부터 시작해, 정책을 학습하는 강력한 접근법인 REINFORCE 알고리즘을 구현합니다. 이어서 Actor-Critic 방법을 다루며, 정책 경사와 가치 기반 방법의 장점을 결합해 학습 효율성과 안정성을 높이는 Advantage Actor-Critic(A2C) 알고리즘에 집중합니다.
강건한 DRL 성능을 위한 Proximal Policy Optimization(PPO)을 탐구합니다. 다음으로, 결정적 정책에 성급히 수렴하는 것을 막아 탐색을 장려하는 엔트로피 보너스를 PPO에서 어떻게 사용하는지 살펴봅니다. 또한 정책 경사 방법에서의 배치 업데이트를 학습합니다. 마지막으로, DRL 모델의 성능을 높이기 위한 강력한 도구인 Optuna로 하이퍼파라미터를 최적화하는 방법을 배웁니다.