Tính Q-value
Mục tiêu của bạn là tính action-value, còn gọi là Q-value, cho từng cặp state-action trong môi trường MyGridWorld tùy chỉnh khi làm theo chính sách dưới đây. Trong RL, Q-value rất quan trọng vì chúng biểu diễn lợi ích kỳ vọng khi thực hiện một hành động cụ thể ở một trạng thái nhất định, rồi tiếp tục tuân theo chính sách đó.

Môi trường đã được import dưới tên env cùng với hàm compute_state_value() và các biến cần thiết (terminal_state, num_states, num_actions, policy, gamma).
Bài tập này là một phần của khóa học
Reinforcement Learning với Gymnasium trong Python
Hướng dẫn bài tập
- Hoàn thiện hàm
compute_q_value()để tính action-value chostatevàactionđược cho. - Tạo một dictionary
Qtrong đó mỗi khóa là một cặp state-action, và giá trị tương ứng là Q-value của cặp đó.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
if state == terminal_state:
return None
probability, next_state, reward, done = ____
return ____
# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}
print(Q)