Types de données de notation
Markus regarde beaucoup de films : documentaires, films de super-héros, classiques et drames. En vous appuyant sur votre expérience précédente avec Spark, utilisez le dataframe markus_ratings, qui contient le nombre de fois où Markus a vu des films par genre, et réfléchissez à s’il s’agit d’évaluations implicites ou explicites. Utilisez la méthode groupBy() pour déterminer quel genre a la note la plus élevée, ce qui pourrait influencer les recommandations qu’ALS générerait pour Markus.
Cet exercice fait partie du cours
<cours>Créer des moteurs de recommandation avec PySpark</cours>Instructions de l’exercice
- Utilisez la méthode
groupBy()pour regrouper le dataframemarkus_ratingspar"Genre". - Appliquez la méthode
.sum()pour obtenir le nombre total de films regardés pour chaque genre. - N’oubliez pas d’ajouter la méthode
.show()à la fin pour afficher les décomptes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Group the data by "Genre"
markus_ratings.____("____").____().____()