시작하기무료로 시작하기

결정론적 정책 정의하기

이 연습 문제에서는 동영상에서 보셨던 것과 같은 사용자 정의 환경 MyGridWorld를 사용합니다. 이 환경은 에이전트가 가능한 한 빨리 다이아몬드에 도달하는 것이 목표인 그리드 월드입니다. 아래 그림에 표시된 대로 에이전트의 행동을 안내하는 정책을 정의해 보세요.

Image showing the policy: 
states 0, 1, 6, 7 - action right. 
states 2, 3 - action down. 
states 4, 5 - action left.

행동은 다음과 같이 표현됩니다: (0 → left, 1 → down, 2 → right, 3 → up).

gymnasium 라이브러리는 gym으로, 그리고 render() 함수도 함께 임포트되어 있습니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Gymnasium 기반 Reinforcement Learning

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create the environment
env = ____
state, info = env.reset()

# Define the policy
policy = ____
코드 편집 및 실행