Parcimonie d'une matrice
Un défi courant avec les données d'évaluation réelles, c'est que la plupart des personnes utilisatrices n'auront pas évalué la plupart des éléments, et que la majorité des éléments n'auront été évalués que par un petit nombre de personnes. Il en résulte un DataFrame très vide, ou parcimonieux.
Dans cet exercice, vous allez calculer à quel point les données d'évaluations movie_lens sont parcellaires en comptant le nombre de cellules occupées et en le comparant à la taille du DataFrame complet.
Le DataFrame user_ratings_df que vous avez utilisé dans les exercices précédents, contenant une ligne par personne utilisatrice et une colonne par film, a été chargé pour vous.
Cette activité fait partie du cours
Créer des moteurs de recommandation en Python
Instructions de l’exercice
- Comptez le nombre de cellules non vides dans
user_ratings_dfet enregistrez le résultat danssparsity_count. - Comptez le nombre total de cellules dans le DataFrame
user_ratings_dfet enregistrez-le dansfull_count. - Calculez la parcimonie du DataFrame en divisant le nombre de cellules non vides par le nombre total de cellules et affichez le résultat.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Count the occupied cells
sparsity_count = user_ratings_df.____().____.____()
# Count all cells
full_count = user_ratings_df.____
# Find the sparsity of the DataFrame
sparsity = ____ / ____
print(sparsity)