CommencerCommencez gratuitement

Les méthodes GroupBy et Filter

Maintenant que vous en savez un peu plus sur le jeu de données, examinons quelques métriques récapitulatives générales du jeu de données ratings pour voir combien d’évaluations les films ont reçues et combien d’évaluations chaque utilisateur a fournies.

Deux méthodes courantes vous seront utiles pour agréger des statistiques descriptives dans Spark : .filter() et .groupBy(). La méthode .filter() vous permet d’exclure les données qui ne remplissent pas vos critères.

Cet exercice fait partie du cours

<cours>Créer des moteurs de recommandation avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Importez col depuis pyspark.sql.functions, et affichez le jeu de données ratings avec .show().
  • Appliquez la méthode .filter() au jeu de données ratings avec le filtre suivant entre parenthèses afin d’inclure uniquement les userId inférieurs à 100 : col("userId") < 100.
  • Appelez la méthode .groupBy() sur le jeu de données ratings pour regrouper les données par userId. Appelez ensuite .count() pour voir combien de films chaque userId a notés.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
Modifier et exécuter le code