Tạo tập (episode) cho các phương pháp Monte Carlo
Các phương pháp Monte Carlo cần tạo ra các tập (episode) để suy ra hàm giá trị. Vì vậy, giờ bạn sẽ triển khai một hàm tạo episode bằng cách chọn hành động ngẫu nhiên cho đến khi episode kết thúc. Ở các bài tập sau, bạn sẽ gọi hàm này để áp dụng các phương pháp Monte Carlo trên môi trường tùy chỉnh env đã được nạp sẵn cho bạn.
Hàm render() đã được nạp sẵn cho bạn.
Bài tập này là một phần của khóa học
Reinforcement Learning với Gymnasium trong Python
Hướng dẫn bài tập
- Đặt lại môi trường với
seedbằng 42. - Trong vòng lặp của episode, chọn một
actionngẫu nhiên ở mỗi lần lặp. - Khi một lần lặp kết thúc, cập nhật dữ liệu
episodebằng cách thêm bộ ba(state, action, reward).
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
def generate_episode():
episode = []
# Reset the environment
state, info = ____
terminated = False
while not terminated:
# Select a random action
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
render()
# Update episode data
episode.____(____)
state = next_state
return episode
print(generate_episode())