CommencezCommencez gratuitement

Normalisez vos données

Avant de pouvoir trouver les facteurs de la matrice des évaluations à l'aide de la décomposition en valeurs singulières, vous devez la « décentrer », ou la centrer, en soustrayant la moyenne de chaque ligne de chacune des valeurs de cette ligne.

Dans cet exercice, vous commencerez à préparer le DataFrame des évaluations de films avec lequel vous travaillez afin de pouvoir effectuer la décomposition en valeurs singulières.

user_ratings_df contient une ligne par utilisateur et une colonne par film, et a été chargé pour vous.

Cette activité fait partie du cours

Créer des moteurs de recommandation en Python

Voir le cours

Instructions de l’exercice

  • Trouvez la note moyenne que chaque utilisateur a donnée pour tous les films qu'il a vus et enregistrez ces valeurs dans avg_ratings.
  • Soustrayez la moyenne de chaque ligne de sa ligne correspondante et enregistrez le résultat dans user_ratings_centered.
  • Enfin, remplacez toutes les valeurs manquantes de user_ratings_centered par des zéros.
  • Affichez la moyenne de chaque colonne de user_ratings_centered pour montrer que les lignes ont été décentrées.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Get the average rating for each user 
avg_ratings = user_ratings_df.____(axis=1)

# Center each user's ratings around 0
user_ratings_centered = user_ratings_df.____(____, axis=1)

# Fill in all missing values with 0s
user_ratings_centered.____(0, inplace=True)

# Print the mean of each column
print(user_ratings_centered.____(axis=1))
Modifier et exécuter le code