EmpezarEmpieza gratis

Los métodos GroupBy y Filter

Ahora que sabemos un poco más sobre el conjunto de datos, veamos algunos indicadores generales del conjunto ratings y comprobemos cuántas valoraciones tienen las películas y cuántas valoraciones ha aportado cada usuario.

Dos métodos habituales que te serán útiles al agregar estadísticas resumidas en Spark son .filter() y .groupBy(). El método .filter() te permite excluir cualquier dato que no cumpla los criterios que especifiques.

Este ejercicio forma parte del curso

Creación de motores de recomendación con PySpark

Ver curso

Instrucciones del ejercicio

  • Importa col desde pyspark.sql.functions y visualiza el conjunto ratings usando .show().
  • Aplica el método .filter() sobre el conjunto ratings con el siguiente filtro entre paréntesis para incluir solo los userId menores que 100: col("userId") < 100.
  • Llama al método .groupBy() sobre el conjunto ratings para agrupar los datos por userId. Llama al método .count() para ver cuántas películas ha valorado cada userId.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
Editar y ejecutar código