Дослідження просторів станів і дій
Середовище Cliff Walking передбачає, що агент перетинає ґратчастий світ від старту до цілі, уникаючи обриву. Якщо гравець переходить на клітинку з обривом, він повертається на старт. Рухи виконуються, доки гравець не досягне цілі — тоді епізод завершується. Ваше завдання — дослідити простори станів і дій цього середовища.

Ця вправа є частиною курсу
Reinforcement Learning з Gymnasium у Python
Інструкції до вправи
- Створіть екземпляр середовища Cliff Walking з ідентифікатором середовища
CliffWalking. - Обчисліть розмір простору дій і збережіть його у змінній
num_actions. - Обчисліть розмір простору станів і збережіть його у змінній
num_states.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create the Cliff Walking environment
env = ____
# Compute the size of the action space
num_actions = ____
# Compute the size of the state space
num_states = ____
print("Number of actions:", num_actions)
print("Number of states:", num_states)