Tính giá trị-trạng-thái cho một policy
Vẫn với môi trường xác định MyGridWorld, giờ bạn cần đánh giá mức độ hiệu quả của policy bạn đã định nghĩa ở bài trước. Bạn sẽ thực hiện điều này bằng cách tính hàm giá trị-trạng-thái cho từng trạng thái dưới policy này.
Môi trường đã được nhập là env cùng với các biến cần thiết (terminal_state, num_states, policy, gamma).
Bài tập này là một phần của khóa học
Reinforcement Learning với Gymnasium trong Python
Hướng dẫn bài tập
- Hoàn thiện hàm
compute_state_value()để tính giá trị cho mỗi trạng thái theo policy đã cho. - Tạo một dictionary
state_valuestrong đó mỗi khóa làstate, và mỗi giá trị là giá trị-trạng-thái tương ứng.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Complete the function
def compute_state_value(state):
if state == terminal_state:
return ____
action = ____
_, next_state, reward, _ = env.unwrapped.P[state][action][0]
return ____
# Compute all state values
state_values = {____: ____ for ____ in range(____)}
print(state_values)