CommencezCommencez gratuitement

Probabilités de transition et récompenses

L'environnement Cliff Walking compte 48 états, numérotés de 0 à 47, ligne par ligne, du coin supérieur gauche (0) au coin inférieur droit (47). Votre objectif est d'examiner la structure des probabilités de transition et des récompenses dans ce contexte. À noter : toutes les récompenses, y compris celle liée à l'atteinte de l'objectif, sont négatives dans cet environnement. Ce choix de conception met l'accent sur la minimisation du nombre d'étapes, puisque chaque déplacement entraîne une pénalité. L'efficacité devient donc un élément clé pour concevoir des algorithmes d'apprentissage performants.

La bibliothèque gymnasium a été importée sous le nom gym et l'environnement sous le nom env. De plus, num_states et num_actions de l'exercice précédent ont été importés.

Image montrant l'environnement cliff walking.

Cette activité fait partie du cours

Reinforcement Learning avec Gymnasium en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Choose the state
state = ____

# Extract transitions for each state-action pair
for action in range(num_actions):
    transitions = ____
    # Print details of each transition
    for transition in transitions:
        ____, ____, ____, ____ = transition
        print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")
Modifier et exécuter le code