시작하기무료로 시작하기

RL 상호작용 루프

이제 아시다시피, RL은 에이전트가 환경에서 의사 결정을 내려 누적 보상을 최대화하는 과정입니다. 에이전트는 상호작용을 통해 어떤 행동이 가장 큰 보상을 주는지 탐색해야 합니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Gymnasium 기반 Reinforcement Learning

강의 보기

실습형 인터랙티브 연습문제

이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요

연습 시작