Bắt đầu ngayBắt đầu miễn phí

Cải thiện policy

Trong bài trước, bạn đã tính các giá trị Q cho từng cặp trạng thái–hành động trong môi trường MyGridWorld. Bây giờ, bạn sẽ dùng các giá trị Q này để cải thiện policy hiện có. Cải thiện policy là bước quan trọng trong reinforcement learning, nơi bạn nâng chất lượng policy bằng cách chọn các hành động tối đa hóa lợi ích kỳ vọng (Q-value) ở mỗi trạng thái. Sau khi cải thiện policy, bạn sẽ hiển thị các bước di chuyển mới theo policy đã cải thiện này.

Môi trường đã được nhập là env, cùng với các giá trị Q là Q, và hàm render().

Bài tập này là một phần của khóa học

Reinforcement Learning với Gymnasium trong Python

Xem khóa học

Hướng dẫn bài tập

  • Tìm hành động tốt nhất cho mỗi trạng thái dựa trên các Q-value.
  • Chọn action đúng dựa trên improved_policy.
  • Thực thi action đã chọn để quan sát kết quả.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

improved_policy = {}

for state in range(num_states-1):
    # Find the best action for each state based on Q-values
    max_action = ____
    improved_policy[state] = max_action

terminated = False
while not terminated:
  # Select action based on policy 
  action = ____
  # Execute the action
  state, reward, terminated, truncated, info = ____
  render()
Chỉnh sửa và Chạy Mã