시작하기무료로 시작하기

SARSA로 8x8 Frozen Lake 풀기

이 연습 문제에서는 이전에 구현한 update_q_table() 함수를 포함한 SARSA 알고리즘을 적용하여 8x8 Frozen Lake 환경에서 최적 정책을 학습해 보겠습니다. 이 환경은 클래식한 4x4 환경과 동일하지만 크기만 더 큽니다. 환경에서 받은 보상에 기반해 SARSA 알고리즘으로 에이전트의 정책을 반복적으로 향상시킬 거예요.

Q-테이블 Q가 초기화되어 미리 로드되어 있으며, 이전 연습 문제의 update_q_table() 함수도 함께 제공됩니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Gymnasium 기반 Reinforcement Learning

강의 보기

연습 안내

  • 학습 과정의 각 에피소드마다 선택한 action을 실행하세요.
  • next_action은 무작위로 선택하세요.
  • 주어진 stateaction에 대해 Q-테이블을 업데이트하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

for episode in range(num_episodes):
    state, info = env.reset()
    action = env.action_space.sample()
    terminated = False
    while not terminated:
      	# Execute the action
        next_state, reward, terminated, truncated, info = ____
        # Choose the next action randomly
        next_action = ____
        # Update the Q-table
        ____
        state, action = next_state, next_action   
render_policy(get_policy())
코드 편집 및 실행