CommencezCommencez gratuitement

Les méthodes GroupBy et Filter

Maintenant que nous en savons un peu plus sur l'ensemble de données, examinons quelques mesures sommaires générales de l'ensemble ratings pour voir combien de cotes les films ont et combien de cotes chaque utilisateur a fournies.

Deux méthodes courantes qui vous seront utiles pour regrouper des statistiques sommaires dans Spark sont .filter() et .groupBy(). La méthode .filter() vous permet d'exclure les données qui ne répondent pas à vos critères.

Cette activité fait partie du cours

Créer des moteurs de recommandation avec PySpark

Voir le cours

Instructions de l’exercice

  • Importez col depuis pyspark.sql.functions, et affichez l'ensemble ratings avec .show().
  • Appliquez la méthode .filter() sur l'ensemble ratings avec le filtre suivant entre parenthèses afin d'inclure uniquement les userId inférieurs à 100 : col("userId") < 100.
  • Appelez la méthode .groupBy() sur l'ensemble ratings pour regrouper les données par userId. Appelez ensuite .count() pour voir combien de films chaque userId a évalués.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
Modifier et exécuter le code