Bắt đầu ngayBắt đầu miễn phí

Tạo tập (episode) cho các phương pháp Monte Carlo

Các phương pháp Monte Carlo cần tạo ra các tập (episode) để suy ra hàm giá trị. Vì vậy, giờ bạn sẽ triển khai một hàm tạo episode bằng cách chọn hành động ngẫu nhiên cho đến khi episode kết thúc. Ở các bài tập sau, bạn sẽ gọi hàm này để áp dụng các phương pháp Monte Carlo trên môi trường tùy chỉnh env đã được nạp sẵn cho bạn.

Hàm render() đã được nạp sẵn cho bạn.

Bài tập này là một phần của khóa học

Reinforcement Learning với Gymnasium trong Python

Xem khóa học

Hướng dẫn bài tập

  • Đặt lại môi trường với seed bằng 42.
  • Trong vòng lặp của episode, chọn một action ngẫu nhiên ở mỗi lần lặp.
  • Khi một lần lặp kết thúc, cập nhật dữ liệu episode bằng cách thêm bộ ba (state, action, reward).

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

def generate_episode():
    episode = []
    # Reset the environment
    state, info = ____
    terminated = False
    while not terminated:
      # Select a random action
      action = ____
      next_state, reward, terminated, truncated, info = env.step(action)
      render()
      # Update episode data
      episode.____(____)
      state = next_state
    return episode
print(generate_episode())
Chỉnh sửa và Chạy Mã