Імовірності переходів і винагороди
Середовище Cliff Walking має 48 станів, пронумерованих від 0 до 47, пострічково: від верхнього лівого кута (0) до нижнього правого (47). Ваше завдання — дослідити структуру ймовірностей переходів і винагород у цьому налаштуванні. Зверніть увагу: усі винагороди, зокрема за досягнення цілі, у цьому середовищі від'ємні. Такий дизайн підкреслює мінімізацію кількості кроків, адже кожен крок має штраф. Тому ефективність є ключовою для розробки результативних алгоритмів навчання.
Бібліотеку gymnasium імпортовано як gym, а середовище — як env. Також імпортовано num_states і num_actions з попередньої вправи.

Ця вправа є частиною курсу
Reinforcement Learning з Gymnasium у Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Choose the state
state = ____
# Extract transitions for each state-action pair
for action in range(num_actions):
transitions = ____
# Print details of each transition
for transition in transitions:
____, ____, ____, ____ = transition
print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")