SARSA로 8x8 Frozen Lake 풀기
이 연습 문제에서는 이전에 구현한 update_q_table() 함수를 포함한 SARSA 알고리즘을 적용하여 8x8 Frozen Lake 환경에서 최적 정책을 학습해 보겠습니다. 이 환경은 클래식한 4x4 환경과 동일하지만 크기만 더 큽니다. 환경에서 받은 보상에 기반해 SARSA 알고리즘으로 에이전트의 정책을 반복적으로 향상시킬 거예요.
Q-테이블 Q가 초기화되어 미리 로드되어 있으며, 이전 연습 문제의 update_q_table() 함수도 함께 제공됩니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Gymnasium 기반 Reinforcement Learning
연습 안내
- 학습 과정의 각 에피소드마다 선택한
action을 실행하세요. next_action은 무작위로 선택하세요.- 주어진
state와action에 대해 Q-테이블을 업데이트하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
for episode in range(num_episodes):
state, info = env.reset()
action = env.action_space.sample()
terminated = False
while not terminated:
# Execute the action
next_state, reward, terminated, truncated, info = ____
# Choose the next action randomly
next_action = ____
# Update the Q-table
____
state, action = next_state, next_action
render_policy(get_policy())