정책의 상태 가치 계산하기
동일한 결정적 환경 MyGridWorld에서, 이제 이전 연습 문제에서 정의한 정책이 얼마나 효과적인지 평가해야 해요. 이를 위해 이 정책하에서 각 상태의 상태 가치 함수를 계산할 거예요.
환경은 필요한 변수들(terminal_state, num_states, policy, gamma)과 함께 env로 이미 가져와 두었어요.
이 연습은 강의의 일부입니다
Python으로 배우는 Gymnasium 기반 Reinforcement Learning
연습 안내
- 주어진 정책에서 각 상태의 가치를 계산하도록
compute_state_value()함수를 완성하세요. - 각 키가
state이고 각 값이 해당 상태 가치인state_values딕셔너리를 만드세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Complete the function
def compute_state_value(state):
if state == terminal_state:
return ____
action = ____
_, next_state, reward, _ = env.unwrapped.P[state][action][0]
return ____
# Compute all state values
state_values = {____: ____ for ____ in range(____)}
print(state_values)