Улучшение политики
В предыдущем упражнении вы вычислили Q-значения для каждой пары «состояние — действие» в среде MyGridWorld. Теперь вы используете эти Q-значения, чтобы улучшить существующую политику. Улучшение политики — ключевой шаг в обучении с подкреплением: вы совершенствуете политику, выбирая действия, которые максимизируют ожидаемую полезность (Q-значение) в каждом состоянии. После улучшения политики вы отобразите новые перемещения агента в соответствии с ней.
Среда импортирована как env, Q-значения — как Q, также доступна функция render().
Это упражнение является частью курса
Обучение с подкреплением с Gymnasium на Python
Инструкции к упражнению
- Найдите наилучшее действие для каждого состояния на основе Q-значений.
- Выберите подходящее
actionв соответствии сimproved_policy. - Выполните выбранное
action, чтобы наблюдать его результат.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
improved_policy = {}
for state in range(num_states-1):
# Find the best action for each state based on Q-values
max_action = ____
improved_policy[state] = max_action
terminated = False
while not terminated:
# Select action based on policy
action = ____
# Execute the action
state, reward, terminated, truncated, info = ____
render()