Les méthodes GroupBy et Filter
Maintenant que vous en savez un peu plus sur le jeu de données, examinons quelques métriques récapitulatives générales du jeu de données ratings pour voir combien d’évaluations les films ont reçues et combien d’évaluations chaque utilisateur a fournies.
Deux méthodes courantes vous seront utiles pour agréger des statistiques descriptives dans Spark : .filter() et .groupBy(). La méthode .filter() vous permet d’exclure les données qui ne remplissent pas vos critères.
Cet exercice fait partie du cours
<cours>Créer des moteurs de recommandation avec PySpark</cours>Instructions de l’exercice
- Importez
coldepuispyspark.sql.functions, et affichez le jeu de donnéesratingsavec.show(). - Appliquez la méthode
.filter()au jeu de donnéesratingsavec le filtre suivant entre parenthèses afin d’inclure uniquement lesuserIdinférieurs à 100 :col("userId") < 100. - Appelez la méthode
.groupBy()sur le jeu de donnéesratingspour regrouper les données paruserId. Appelez ensuite.count()pour voir combien de films chaqueuserIda notés.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()