Créer un bandit à plusieurs bras
Un problème de bandit à plusieurs bras est un exemple classique en reinforcement learning qui décrit une situation où un agent doit choisir entre plusieurs actions (ou « bras ») sans connaître la récompense attendue de chacune. Avec le temps, l'agent apprend quel bras offre la meilleure récompense en explorant chaque option. Cet exercice consiste à mettre en place la structure de base pour simuler un problème de bandit à plusieurs bras.
La bibliothèque numpy a été importée sous le nom np.
Cette activité fait partie du cours
Reinforcement Learning avec Gymnasium en Python
Instructions de l’exercice
- Générez un tableau
true_bandit_probsavec des probabilités aléatoires représentant le taux de succès réel de chaque bandit. - Initialisez deux tableaux,
countsetvalues, avec des zéros;countssuit le nombre de fois où chaque bandit a été choisi, etvaluesreprésente la probabilité de gain estimée pour chaque bandit. - Créez les tableaux
rewardsetselected_armspour enregistrer les récompenses obtenues et les bras sélectionnés à chaque itération.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
def create_multi_armed_bandit(n_bandits):
# Generate the true bandits probabilities
true_bandit_probs = ____
# Create arrays that store the count and value for each bandit
counts = ____
values = ____
# Create arrays that store the rewards and selected arms each episode
rewards = ____
selected_arms = ____
return true_bandit_probs, counts, values, rewards, selected_arms