Probabilités de transition et récompenses
L'environnement Cliff Walking compte 48 états, numérotés de 0 à 47, ligne par ligne, du coin supérieur gauche (0) au coin inférieur droit (47). Votre objectif est d'examiner la structure des probabilités de transition et des récompenses dans ce contexte. À noter : toutes les récompenses, y compris celle liée à l'atteinte de l'objectif, sont négatives dans cet environnement. Ce choix de conception met l'accent sur la minimisation du nombre d'étapes, puisque chaque déplacement entraîne une pénalité. L'efficacité devient donc un élément clé pour concevoir des algorithmes d'apprentissage performants.
La bibliothèque gymnasium a été importée sous le nom gym et l'environnement sous le nom env. De plus, num_states et num_actions de l'exercice précédent ont été importés.

Cette activité fait partie du cours
Reinforcement Learning avec Gymnasium en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Choose the state
state = ____
# Extract transitions for each state-action pair
for action in range(num_actions):
transitions = ____
# Print details of each transition
for transition in transitions:
____, ____, ____, ____ = transition
print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")