Aan de slagBegin gratis

De methodes GroupBy en Filter

Nu we iets meer weten over de gegevensset, bekijken we enkele algemene samenvattende statistieken van de ratings-gegevensset en zien we hoeveel beoordelingen de films hebben en hoeveel beoordelingen elke gebruiker heeft gegeven.

Twee veelgebruikte methodes die je helpen bij het aggregeren van samenvattingsstatistieken in Spark zijn .filter() en .groupBy(). Met .filter() kun je alle gegevens wegfilteren die niet aan je criteria voldoen.

Deze oefening maakt deel uit van de cursus

Aanbevelingssystemen bouwen met PySpark

Bekijk cursus

Oefeninstructies

  • Importeer col uit pyspark.sql.functions, en bekijk de ratings-gegevensset met .show().
  • Pas de methode .filter() toe op de ratings-gegevensset met de volgende filter tussen de haakjes om alleen userId's kleiner dan 100 op te nemen: col("userId") < 100.
  • Roep de methode .groupBy() aan op de ratings-gegevensset om de data te groeperen op userId. Roep daarna .count() aan om te zien hoeveel films elke userId heeft beoordeeld.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
Code bewerken en uitvoeren