Bắt đầu ngayBắt đầu miễn phí

Vòng lặp tương tác RL

Như bạn đã biết, RL bao gồm một agent đưa ra quyết định trong môi trường để tối đa hóa phần thưởng tích lũy. Agent phải khám phá hành động nào mang lại nhiều phần thưởng nhất thông qua tương tác.

Bài tập này là một phần của khóa học

Reinforcement Learning với Gymnasium trong Python

Xem khóa học

Bài tập tương tác thực hành

Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi

Bắt đầu bài tập