Statistiques récapitulatives de MSD
Familiarisons-nous avec le sous-ensemble Echo Nest Taste Profile du Million Songs. Dans ce cours, nous l’appellerons simplement le Million Songs dataset ou msd. Récupérons le nombre d’utilisateurs et le nombre de chansons. Voyons aussi quelles chansons ont le plus d’écoutes dans ce sous-ensemble.
Cet exercice fait partie du cours
<cours>Créer des moteurs de recommandation avec PySpark</cours>Instructions de l’exercice
- Utilisez la méthode
.show()pour voir à quoi ressemblent les données. - Complétez le code pour compter le nombre de
userIddistincts. Sélectionnez la colonneuserId, puis appelez.distinct()et.count(). - Faites maintenant la même chose pour les
songId: comptez le nombre desongIddistincts. Sélectionnez la colonnesongId, puis appelez.distinct()et.count()dessus.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Look at the data
msd.____()
# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)
# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)