Cải thiện policy
Trong bài trước, bạn đã tính các giá trị Q cho từng cặp trạng thái–hành động trong môi trường MyGridWorld. Bây giờ, bạn sẽ dùng các giá trị Q này để cải thiện policy hiện có. Cải thiện policy là bước quan trọng trong reinforcement learning, nơi bạn nâng chất lượng policy bằng cách chọn các hành động tối đa hóa lợi ích kỳ vọng (Q-value) ở mỗi trạng thái. Sau khi cải thiện policy, bạn sẽ hiển thị các bước di chuyển mới theo policy đã cải thiện này.
Môi trường đã được nhập là env, cùng với các giá trị Q là Q, và hàm render().
Bài tập này là một phần của khóa học
Reinforcement Learning với Gymnasium trong Python
Hướng dẫn bài tập
- Tìm hành động tốt nhất cho mỗi trạng thái dựa trên các Q-value.
- Chọn
actionđúng dựa trênimproved_policy. - Thực thi
actionđã chọn để quan sát kết quả.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
improved_policy = {}
for state in range(num_states-1):
# Find the best action for each state based on Q-values
max_action = ____
improved_policy[state] = max_action
terminated = False
while not terminated:
# Select action based on policy
action = ____
# Execute the action
state, reward, terminated, truncated, info = ____
render()