CommencerCommencez gratuitement

Types de données de notation

Markus regarde beaucoup de films : documentaires, films de super-héros, classiques et drames. En vous appuyant sur votre expérience précédente avec Spark, utilisez le dataframe markus_ratings, qui contient le nombre de fois où Markus a vu des films par genre, et réfléchissez à s’il s’agit d’évaluations implicites ou explicites. Utilisez la méthode groupBy() pour déterminer quel genre a la note la plus élevée, ce qui pourrait influencer les recommandations qu’ALS générerait pour Markus.

Cet exercice fait partie du cours

<cours>Créer des moteurs de recommandation avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Utilisez la méthode groupBy() pour regrouper le dataframe markus_ratings par "Genre".
  • Appliquez la méthode .sum() pour obtenir le nombre total de films regardés pour chaque genre.
  • N’oubliez pas d’ajouter la méthode .show() à la fin pour afficher les décomptes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Group the data by "Genre"
markus_ratings.____("____").____().____()
Modifier et exécuter le code