or
이 연습은 강의의 일부입니다
Reinforcement Learning(RL)의 기초 개념, 역할, 활용 분야를 살펴보며 흥미로운 RL 세계로 들어가 보세요. 에이전트-환경 상호작용을 중심으로 RL 프레임워크를 이해하고, Gymnasium 라이브러리로 환경을 만들고, 상태를 시각화하며, 행동을 수행하는 방법을 배워 RL 개념과 응용에 대한 실전 기반을 다집니다.
Model-Based Learning에 초점을 맞춰 RL을 더 깊이 있게 다룹니다. 마코프 의사결정 과정(MDP)의 구성 요소를 이해하며 복잡한 개념을 풀어 봅니다. 정책과 가치 함수에 대한 지식을 확장하고, 정책 반복과 가치 반복 기법으로 정책 최적화 역량을 키우세요.
현재 연습
RL에서 Model-Free Learning의 역동적인 세계를 탐험합니다. 기초가 되는 몬테카를로 방법을 소개하고, 최초 방문과 매 방문 몬테카를로 예측 알고리즘을 적용해 봅니다. 이어서 시차 학습(Temporal Difference Learning)으로 넘어가 SARSA 알고리즘을 살펴봅니다. 마지막으로 Q-Learning을 깊이 있게 학습하고, 까다로운 환경에서의 수렴 특성을 분석합니다.
Model-Free RL의 고급 전략을 통해 의사 결정 알고리즘을 한층 강화합니다. 더 정확한 정책 업데이트를 위한 Expected SARSA와 과대추정 편향을 완화하는 Double Q-learning을 학습하세요. 탐험-활용 균형을 다루며, 최적의 행동 선택을 위한 입실론-그리디와 입실론 감소 전략을 익힙니다. 또한 다중 슬롯머신(Multi-Armed Bandit) 문제를 해결하며 불확실성하 의사 결정 과제를 다뤄 봅니다.