Áp dụng lặp chính sách để tìm chính sách tối ưu
Policy iteration là một kỹ thuật nền tảng trong RL để tìm ra chính sách tối ưu. Quy trình gồm hai bước chính: đánh giá chính sách, nơi bạn tính hàm giá trị trạng thái cho một chính sách đã cho, và cải thiện chính sách, nơi bạn cập nhật chính sách dựa trên các giá trị này. Bạn sẽ lặp lại hai bước này cho đến khi hội tụ về chính sách tối ưu trong môi trường tùy chỉnh MyGridWorld.
Hàm render_policy() sẽ được dùng để hiển thị các bước mà tác nhân thực hiện theo một chính sách.
Các hàm compute_state_value(state, policy) và compute_q_value(state, action, policy) đã được nạp sẵn cho bạn.
Bài tập này là một phần của khóa học
Reinforcement Learning với Gymnasium trong Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Complete the policy evaluation function
def policy_evaluation(policy):
V = {____: ____ for ____ in range(____)}
return V