Bắt đầu ngayBắt đầu miễn phí

Tính giá trị-trạng-thái cho một policy

Vẫn với môi trường xác định MyGridWorld, giờ bạn cần đánh giá mức độ hiệu quả của policy bạn đã định nghĩa ở bài trước. Bạn sẽ thực hiện điều này bằng cách tính hàm giá trị-trạng-thái cho từng trạng thái dưới policy này.

Môi trường đã được nhập là env cùng với các biến cần thiết (terminal_state, num_states, policy, gamma).

Bài tập này là một phần của khóa học

Reinforcement Learning với Gymnasium trong Python

Xem khóa học

Hướng dẫn bài tập

  • Hoàn thiện hàm compute_state_value() để tính giá trị cho mỗi trạng thái theo policy đã cho.
  • Tạo một dictionary state_values trong đó mỗi khóa là state, và mỗi giá trị là giá trị-trạng-thái tương ứng.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Complete the function
def compute_state_value(state):
    if state == terminal_state:
        return ____
    action = ____
    _, next_state, reward, _ = env.unwrapped.P[state][action][0]
    return ____

# Compute all state values 
state_values = {____: ____ for ____ in range(____)}

print(state_values)
Chỉnh sửa và Chạy Mã