ÎncepețiÎncepe gratuit

Metodele GroupBy și Filter

Acum că știm ceva mai multe despre setul de date, să analizăm câteva statistici generale de rezumat ale setului de date ratings și să vedem câte evaluări au primit filmele, respectiv câte evaluări a oferit fiecare utilizator.

Două metode utile atunci când agregezi statistici de rezumat în Spark sunt .filter() și .groupBy(). Metoda .filter() îți permite să elimini datele care nu îndeplinesc criteriile specificate.

Acest exercițiu face parte din cursul

Construiește motoare de recomandare cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă col din pyspark.sql.functions și vizualizează setul de date ratings folosind .show().
  • Aplică metoda .filter() pe setul de date ratings cu următorul filtru în paranteză, pentru a include doar userId-urile mai mici decât 100: col("userId") < 100.
  • Apelează metoda .groupBy() pe setul de date ratings pentru a grupa datele după userId. Apelează metoda .count() pentru a vedea câte filme a evaluat fiecare userId.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
Editează și rulează codul