Los métodos GroupBy y Filter
Ahora que sabemos un poco más sobre el conjunto de datos, veamos algunos indicadores generales del conjunto ratings y comprobemos cuántas valoraciones tienen las películas y cuántas valoraciones ha aportado cada usuario.
Dos métodos habituales que te serán útiles al agregar estadísticas resumidas en Spark son .filter() y .groupBy(). El método .filter() te permite excluir cualquier dato que no cumpla los criterios que especifiques.
Este ejercicio forma parte del curso
Creación de motores de recomendación con PySpark
Instrucciones del ejercicio
- Importa
coldesdepyspark.sql.functionsy visualiza el conjuntoratingsusando.show(). - Aplica el método
.filter()sobre el conjuntoratingscon el siguiente filtro entre paréntesis para incluir solo losuserIdmenores que 100:col("userId") < 100. - Llama al método
.groupBy()sobre el conjuntoratingspara agrupar los datos poruserId. Llama al método.count()para ver cuántas películas ha valorado cadauserId.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()