Покращення політики
У попередній вправі ви обчислили значення Q для кожної пари стан–дія в середовищі MyGridWorld. Тепер ви використаєте ці Q-значення, щоб покращити наявну політику. Покращення політики — це ключовий крок у навчанні з підкріпленням: ви вдосконалюєте політику, обираючи дії, що максимізують очікувану корисність (Q-значення) в кожному стані. Після покращення політики ви відобразите нові переміщення згідно з оновленою політикою.
Середовище імпортовано як env, Q-значення — як Q, а також доступна функція render().
Ця вправа є частиною курсу
Reinforcement Learning з Gymnasium у Python
Інструкції до вправи
- Знайдіть найкращу дію для кожного стану на основі Q-значень.
- Виберіть правильний
actionна основіimproved_policy. - Виконайте обрану
action, щоб побачити результат.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
improved_policy = {}
for state in range(num_states-1):
# Find the best action for each state based on Q-values
max_action = ____
improved_policy[state] = max_action
terminated = False
while not terminated:
# Select action based on policy
action = ____
# Execute the action
state, reward, terminated, truncated, info = ____
render()