Les méthodes GroupBy et Filter
Maintenant que nous en savons un peu plus sur l'ensemble de données, examinons quelques mesures sommaires générales de l'ensemble ratings pour voir combien de cotes les films ont et combien de cotes chaque utilisateur a fournies.
Deux méthodes courantes qui vous seront utiles pour regrouper des statistiques sommaires dans Spark sont .filter() et .groupBy(). La méthode .filter() vous permet d'exclure les données qui ne répondent pas à vos critères.
Cette activité fait partie du cours
Créer des moteurs de recommandation avec PySpark
Instructions de l’exercice
- Importez
coldepuispyspark.sql.functions, et affichez l'ensembleratingsavec.show(). - Appliquez la méthode
.filter()sur l'ensembleratingsavec le filtre suivant entre parenthèses afin d'inclure uniquement lesuserIdinférieurs à 100 :col("userId") < 100. - Appelez la méthode
.groupBy()sur l'ensembleratingspour regrouper les données paruserId. Appelez ensuite.count()pour voir combien de films chaqueuserIda évalués.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()