Bắt đầu ngayBắt đầu miễn phí

Tính lợi ích chiết khấu cho các chiến lược của agent

Lợi ích chiết khấu giúp bạn ước lượng tổng phần thưởng mà một agent có thể tích lũy theo thời gian, với giả định rằng phần thưởng ở tương lai có giá trị thấp hơn phần thưởng nhận ngay. Bạn được cung cấp các giá trị phần thưởng kỳ vọng cho hai chiến lược khác nhau (exp_rewards_strategy_1exp_rewards_strategy_2) của một agent trong RL. Nhiệm vụ của bạn là tính lợi ích chiết khấu cho mỗi chiến lược và xác định chiến lược nào cho lợi ích cao hơn.

Thư viện numpy đã được nhập sẵn với bí danh np.

Bài tập này là một phần của khóa học

Reinforcement Learning với Gymnasium trong Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

exp_rewards_strategy_1 = np.array([3, 2, -1, 5])

discount_factor = 0.9

# Compute discounts
discounts_strategy_1 = np.array([____ for i in range(len(exp_rewards_strategy_1))])

# Compute the discounted return
discounted_return_strategy_1 = np.sum(____)

print(f"The discounted return of the first strategy is {discounted_return_strategy_1}")
Chỉnh sửa và Chạy Mã