I metodi GroupBy e Filter
Ora che conosciamo un po' meglio l'insieme di dati, diamo un'occhiata ad alcune metriche riassuntive generali del dataset ratings e vediamo quante valutazioni hanno i film e quante valutazioni ha fornito ciascun utente.
Due metodi comuni che ti saranno utili quando calcoli statistiche riassuntive in Spark sono .filter() e .groupBy(). Il metodo .filter() ti permette di escludere i dati che non soddisfano i criteri specificati.
Questo esercizio fa parte del corso
Costruire motori di raccomandazione con PySpark
Istruzioni dell'esercizio
- Importa
coldapyspark.sql.functionse visualizza il datasetratingsusando.show(). - Applica il metodo
.filter()al datasetratingscon il seguente filtro tra parentesi per includere solo gliuserIdminori di 100:col("userId") < 100. - Chiama il metodo
.groupBy()sul datasetratingsper raggruppare i dati peruserId. Chiama il metodo.count()per vedere quanti film ha valutato ciascunuserId.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()