Bắt đầu ngayBắt đầu miễn phí

Tính Q-value

Mục tiêu của bạn là tính action-value, còn gọi là Q-value, cho từng cặp state-action trong môi trường MyGridWorld tùy chỉnh khi làm theo chính sách dưới đây. Trong RL, Q-value rất quan trọng vì chúng biểu diễn lợi ích kỳ vọng khi thực hiện một hành động cụ thể ở một trạng thái nhất định, rồi tiếp tục tuân theo chính sách đó.

exercise_policy.png

Môi trường đã được import dưới tên env cùng với hàm compute_state_value() và các biến cần thiết (terminal_state, num_states, num_actions, policy, gamma).

Bài tập này là một phần của khóa học

Reinforcement Learning với Gymnasium trong Python

Xem khóa học

Hướng dẫn bài tập

  • Hoàn thiện hàm compute_q_value() để tính action-value cho stateaction được cho.
  • Tạo một dictionary Q trong đó mỗi khóa là một cặp state-action, và giá trị tương ứng là Q-value của cặp đó.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
    if state == terminal_state:
        return None   
    probability, next_state, reward, done = ____
    return ____

# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}

print(Q)
Chỉnh sửa và Chạy Mã