Khởi tạo Q-Network
Bây giờ bạn đã định nghĩa kiến trúc, hãy khởi tạo mạng thực tế mà agent sẽ sử dụng, cùng với bộ tối ưu của nó. Môi trường Lunar Lander có không gian trạng thái có chiều là 8 và không gian hành động có 4 lựa chọn (tương ứng với 0: không làm gì, 1: động cơ đẩy trái, 2: động cơ chính, 3: động cơ đẩy phải).
Lớp QNetwork từ bài tập trước đã sẵn sàng để bạn sử dụng.
Bài tập này là một phần của khóa học
Deep Reinforcement Learning bằng Python
Hướng dẫn bài tập
- Khởi tạo một Q Network cho môi trường Lunar Lander.
- Định nghĩa bộ tối ưu Adam cho mạng nơ-ron, với tốc độ học là 0.0001.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
state_size = 8
action_size = 4
# Instantiate the Q Network
q_network = QNetwork(____, ____)
# Specify the optimizer learning rate
optimizer = optim.Adam(q_network.parameters(), ____)
print("Q-Network initialized as:\n", q_network)