Inizia subitoInizia gratis

I metodi GroupBy e Filter

Ora che conosciamo un po' meglio l'insieme di dati, diamo un'occhiata ad alcune metriche riassuntive generali del dataset ratings e vediamo quante valutazioni hanno i film e quante valutazioni ha fornito ciascun utente.

Due metodi comuni che ti saranno utili quando calcoli statistiche riassuntive in Spark sono .filter() e .groupBy(). Il metodo .filter() ti permette di escludere i dati che non soddisfano i criteri specificati.

Questo esercizio fa parte del corso

Costruire motori di raccomandazione con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Importa col da pyspark.sql.functions e visualizza il dataset ratings usando .show().
  • Applica il metodo .filter() al dataset ratings con il seguente filtro tra parentesi per includere solo gli userId minori di 100: col("userId") < 100.
  • Chiama il metodo .groupBy() sul dataset ratings per raggruppare i dati per userId. Chiama il metodo .count() per vedere quanti film ha valutato ciascun userId.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
Modifica ed esegui il codice