НачатьНачать бесплатно

Улучшение политики

В предыдущем упражнении вы вычислили Q-значения для каждой пары «состояние — действие» в среде MyGridWorld. Теперь вы используете эти Q-значения, чтобы улучшить существующую политику. Улучшение политики — ключевой шаг в обучении с подкреплением: вы совершенствуете политику, выбирая действия, которые максимизируют ожидаемую полезность (Q-значение) в каждом состоянии. После улучшения политики вы отобразите новые перемещения агента в соответствии с ней.

Среда импортирована как env, Q-значения — как Q, также доступна функция render().

Это упражнение является частью курса

Обучение с подкреплением с Gymnasium на Python

Посмотреть курс

Инструкции к упражнению

  • Найдите наилучшее действие для каждого состояния на основе Q-значений.
  • Выберите подходящее action в соответствии с improved_policy.
  • Выполните выбранное action, чтобы наблюдать его результат.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

improved_policy = {}

for state in range(num_states-1):
    # Find the best action for each state based on Q-values
    max_action = ____
    improved_policy[state] = max_action

terminated = False
while not terminated:
  # Select action based on policy 
  action = ____
  # Execute the action
  state, reward, terminated, truncated, info = ____
  render()
Редактировать и запускать код