ПочатиПочніть безкоштовно

Застосування ітерації політики для оптимальної політики

Ітерація політики — це базова техніка в RL для знаходження оптимальної політики. Вона складається з двох основних кроків: оцінювання політики, коли ви обчислюєте функцію цінності станів для заданої політики, та покращення політики, коли ви оновлюєте політику на основі цих значень. Ви застосуєте ці кроки ітеративно, щоб збіжно отримати оптимальну політику в кастомному середовищі MyGridWorld.

Функція render_policy() використовується, щоб показати кроки, які здійснює агент відповідно до політики.

Функції compute_state_value(state, policy) і compute_q_value(state, action, policy) уже підвантажено для вас.

Ця вправа є частиною курсу

Reinforcement Learning з Gymnasium у Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Complete the policy evaluation function
def policy_evaluation(policy):
    V = {____: ____ for ____ in range(____)}
    return V
Редагувати та запускати код