НачатьНачать бесплатно

Вероятности переходов и награды

Среда Cliff Walking (хождение по краю обрыва) содержит 48 состояний, пронумерованных от 0 до 47 построчно, начиная с верхнего левого угла (0) и заканчивая нижним правым (47). Ваша задача — изучить структуру вероятностей переходов и наград в этой среде. Важно отметить, что все награды здесь отрицательны, включая награду за достижение цели. Такой подход стимулирует агента минимизировать количество шагов: каждый шаг влечёт за собой штраф, поэтому эффективность становится ключевым фактором при разработке алгоритмов обучения.

Библиотека gymnasium импортирована как gym, среда — как env. Также из предыдущего упражнения импортированы num_states и num_actions.

Image showing the cliff walking environment.

Это упражнение является частью курса

Обучение с подкреплением с Gymnasium на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Choose the state
state = ____

# Extract transitions for each state-action pair
for action in range(num_actions):
    transitions = ____
    # Print details of each transition
    for transition in transitions:
        ____, ____, ____, ____ = transition
        print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")
Редактировать и запускать код