결정론적 정책 정의하기
이 연습 문제에서는 동영상에서 보셨던 것과 같은 사용자 정의 환경 MyGridWorld를 사용합니다. 이 환경은 에이전트가 가능한 한 빨리 다이아몬드에 도달하는 것이 목표인 그리드 월드입니다. 아래 그림에 표시된 대로 에이전트의 행동을 안내하는 정책을 정의해 보세요.

행동은 다음과 같이 표현됩니다: (0 → left, 1 → down, 2 → right, 3 → up).
gymnasium 라이브러리는 gym으로, 그리고 render() 함수도 함께 임포트되어 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Gymnasium 기반 Reinforcement Learning
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create the environment
env = ____
state, info = env.reset()
# Define the policy
policy = ____