De methodes GroupBy en Filter
Nu we iets meer weten over de gegevensset, bekijken we enkele algemene samenvattende statistieken van de ratings-gegevensset en zien we hoeveel beoordelingen de films hebben en hoeveel beoordelingen elke gebruiker heeft gegeven.
Twee veelgebruikte methodes die je helpen bij het aggregeren van samenvattingsstatistieken in Spark zijn .filter() en .groupBy(). Met .filter() kun je alle gegevens wegfilteren die niet aan je criteria voldoen.
Deze oefening maakt deel uit van de cursus
Aanbevelingssystemen bouwen met PySpark
Oefeninstructies
- Importeer
coluitpyspark.sql.functions, en bekijk deratings-gegevensset met.show(). - Pas de methode
.filter()toe op deratings-gegevensset met de volgende filter tussen de haakjes om alleenuserId's kleiner dan 100 op te nemen:col("userId") < 100. - Roep de methode
.groupBy()aan op deratings-gegevensset om de data te groeperen opuserId. Roep daarna.count()aan om te zien hoeveel films elkeuserIdheeft beoordeeld.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()