शुरू करेंमुफ़्त में शुरू करें

First-visit Monte Carlo लागू करना

Monte Carlo एल्गोरिदम का लक्ष्य Q-table का अनुमान लगाना है ताकि एक optimal पॉलिसी निकाली जा सके. इस अभ्यास में, आप First-Visit Monte Carlo विधि लागू करेंगे ताकि action-value फंक्शन Q का अनुमान लगाया जा सके, और फिर पिछले अभ्यास में देखे गए custom environment को हल करने के लिए optimal पॉलिसी निकाली जा सके. जब भी रिटर्न की गणना करें, discount factor को 1 मानें.

numpy arrays Q, returns_sum, और returns_count पहले से initialize और pre-load किए गए हैं. ये क्रमशः Q-values, रिवार्ड्स के cumulative sum, और प्रत्येक state-action जोड़ी के visit count को स्टोर करते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • वह if कंडीशन परिभाषित करें जिसे first-visit Monte Carlo एल्गोरिदम में जाँचना चाहिए.
  • रिटर्न्स (returns_sum), उनके काउंट्स (returns_count) और visited_states को अपडेट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

for i in range(100):
  episode = generate_episode()
  visited_states = set()
  for j, (state, action, reward) in enumerate(episode):
    # Define the first-visit condition
    if ____ not in ____:
      # Update the returns, their counts and the visited states
      returns_sum[state, action] += ____([____ for ____ in ____])
      returns_count[state, action] += ____
      visited_states.____(____)

nonzero_counts = returns_count != 0

Q[nonzero_counts] = returns_sum[nonzero_counts] / returns_count[nonzero_counts]
render_policy(get_policy())
कोड संपादित करें और चलाएँ