Metodele GroupBy și Filter
Acum că știm ceva mai multe despre setul de date, să analizăm câteva statistici generale de rezumat ale setului de date ratings și să vedem câte evaluări au primit filmele, respectiv câte evaluări a oferit fiecare utilizator.
Două metode utile atunci când agregezi statistici de rezumat în Spark sunt .filter() și .groupBy(). Metoda .filter() îți permite să elimini datele care nu îndeplinesc criteriile specificate.
Acest exercițiu face parte din cursul
Construiește motoare de recomandare cu PySpark
Instrucțiuni pentru exercițiu
- Importă
coldinpyspark.sql.functionsși vizualizează setul de dateratingsfolosind.show(). - Aplică metoda
.filter()pe setul de dateratingscu următorul filtru în paranteză, pentru a include doaruserId-urile mai mici decât 100:col("userId") < 100. - Apelează metoda
.groupBy()pe setul de dateratingspentru a grupa datele dupăuserId. Apelează metoda.count()pentru a vedea câte filme a evaluat fiecareuserId.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()