ПочатиПочніть безкоштовно

Покращення політики

У попередній вправі ви обчислили значення Q для кожної пари стан–дія в середовищі MyGridWorld. Тепер ви використаєте ці Q-значення, щоб покращити наявну політику. Покращення політики — це ключовий крок у навчанні з підкріпленням: ви вдосконалюєте політику, обираючи дії, що максимізують очікувану корисність (Q-значення) в кожному стані. Після покращення політики ви відобразите нові переміщення згідно з оновленою політикою.

Середовище імпортовано як env, Q-значення — як Q, а також доступна функція render().

Ця вправа є частиною курсу

Reinforcement Learning з Gymnasium у Python

Переглянути курс

Інструкції до вправи

  • Знайдіть найкращу дію для кожного стану на основі Q-значень.
  • Виберіть правильний action на основі improved_policy.
  • Виконайте обрану action, щоб побачити результат.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

improved_policy = {}

for state in range(num_states-1):
    # Find the best action for each state based on Q-values
    max_action = ____
    improved_policy[state] = max_action

terminated = False
while not terminated:
  # Select action based on policy 
  action = ____
  # Execute the action
  state, reward, terminated, truncated, info = ____
  render()
Редагувати та запускати код