CommencezCommencez gratuitement

Créer un bandit à plusieurs bras

Un problème de bandit à plusieurs bras est un exemple classique en reinforcement learning qui décrit une situation où un agent doit choisir entre plusieurs actions (ou « bras ») sans connaître la récompense attendue de chacune. Avec le temps, l'agent apprend quel bras offre la meilleure récompense en explorant chaque option. Cet exercice consiste à mettre en place la structure de base pour simuler un problème de bandit à plusieurs bras.

La bibliothèque numpy a été importée sous le nom np.

Cette activité fait partie du cours

Reinforcement Learning avec Gymnasium en Python

Voir le cours

Instructions de l’exercice

  • Générez un tableau true_bandit_probs avec des probabilités aléatoires représentant le taux de succès réel de chaque bandit.
  • Initialisez deux tableaux, counts et values, avec des zéros; counts suit le nombre de fois où chaque bandit a été choisi, et values représente la probabilité de gain estimée pour chaque bandit.
  • Créez les tableaux rewards et selected_arms pour enregistrer les récompenses obtenues et les bras sélectionnés à chaque itération.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

def create_multi_armed_bandit(n_bandits):
  	# Generate the true bandits probabilities
    true_bandit_probs = ____ 
    # Create arrays that store the count and value for each bandit
    counts = ____  
    values = ____  
    # Create arrays that store the rewards and selected arms each episode
    rewards = ____
    selected_arms = ____ 
    return true_bandit_probs, counts, values, rewards, selected_arms
Modifier et exécuter le code