Normalisez vos données
Avant de pouvoir trouver les facteurs de la matrice des évaluations à l'aide de la décomposition en valeurs singulières, vous devez la « décentrer », ou la centrer, en soustrayant la moyenne de chaque ligne de chacune des valeurs de cette ligne.
Dans cet exercice, vous commencerez à préparer le DataFrame des évaluations de films avec lequel vous travaillez afin de pouvoir effectuer la décomposition en valeurs singulières.
user_ratings_df contient une ligne par utilisateur et une colonne par film, et a été chargé pour vous.
Cette activité fait partie du cours
Créer des moteurs de recommandation en Python
Instructions de l’exercice
- Trouvez la note moyenne que chaque utilisateur a donnée pour tous les films qu'il a vus et enregistrez ces valeurs dans
avg_ratings. - Soustrayez la moyenne de chaque ligne de sa ligne correspondante et enregistrez le résultat dans
user_ratings_centered. - Enfin, remplacez toutes les valeurs manquantes de
user_ratings_centeredpar des zéros. - Affichez la moyenne de chaque colonne de
user_ratings_centeredpour montrer que les lignes ont été décentrées.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Get the average rating for each user
avg_ratings = user_ratings_df.____(axis=1)
# Center each user's ratings around 0
user_ratings_centered = user_ratings_df.____(____, axis=1)
# Fill in all missing values with 0s
user_ratings_centered.____(0, inplace=True)
# Print the mean of each column
print(user_ratings_centered.____(axis=1))