First-visit Monte Carlo लागू करना
Monte Carlo एल्गोरिदम का लक्ष्य Q-table का अनुमान लगाना है ताकि एक optimal पॉलिसी निकाली जा सके. इस अभ्यास में, आप First-Visit Monte Carlo विधि लागू करेंगे ताकि action-value फंक्शन Q का अनुमान लगाया जा सके, और फिर पिछले अभ्यास में देखे गए custom environment को हल करने के लिए optimal पॉलिसी निकाली जा सके. जब भी रिटर्न की गणना करें, discount factor को 1 मानें.
numpy arrays Q, returns_sum, और returns_count पहले से initialize और pre-load किए गए हैं. ये क्रमशः Q-values, रिवार्ड्स के cumulative sum, और प्रत्येक state-action जोड़ी के visit count को स्टोर करते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Gymnasium के साथ Reinforcement Learning
अभ्यास निर्देश
- वह
ifकंडीशन परिभाषित करें जिसे first-visit Monte Carlo एल्गोरिदम में जाँचना चाहिए. - रिटर्न्स (
returns_sum), उनके काउंट्स (returns_count) औरvisited_statesको अपडेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
for i in range(100):
episode = generate_episode()
visited_states = set()
for j, (state, action, reward) in enumerate(episode):
# Define the first-visit condition
if ____ not in ____:
# Update the returns, their counts and the visited states
returns_sum[state, action] += ____([____ for ____ in ____])
returns_count[state, action] += ____
visited_states.____(____)
nonzero_counts = returns_count != 0
Q[nonzero_counts] = returns_sum[nonzero_counts] / returns_count[nonzero_counts]
render_policy(get_policy())