Vòng lặp tương tác RL
Như bạn đã biết, RL bao gồm một agent đưa ra quyết định trong môi trường để tối đa hóa phần thưởng tích lũy. Agent phải khám phá hành động nào mang lại nhiều phần thưởng nhất thông qua tương tác.
Bài tập này là một phần của khóa học
Reinforcement Learning với Gymnasium trong Python
Bài tập tương tác thực hành
Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi
Bắt đầu bài tập