ПочатиПочніть безкоштовно

Імовірності переходів і винагороди

Середовище Cliff Walking має 48 станів, пронумерованих від 0 до 47, пострічково: від верхнього лівого кута (0) до нижнього правого (47). Ваше завдання — дослідити структуру ймовірностей переходів і винагород у цьому налаштуванні. Зверніть увагу: усі винагороди, зокрема за досягнення цілі, у цьому середовищі від'ємні. Такий дизайн підкреслює мінімізацію кількості кроків, адже кожен крок має штраф. Тому ефективність є ключовою для розробки результативних алгоритмів навчання.

Бібліотеку gymnasium імпортовано як gym, а середовище — як env. Також імпортовано num_states і num_actions з попередньої вправи.

Image showing the cliff walking environment.

Ця вправа є частиною курсу

Reinforcement Learning з Gymnasium у Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Choose the state
state = ____

# Extract transitions for each state-action pair
for action in range(num_actions):
    transitions = ____
    # Print details of each transition
    for transition in transitions:
        ____, ____, ____, ____ = transition
        print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")
Редагувати та запускати код