Comece agoraComece grátis

Os métodos GroupBy e Filter

Agora que sabemos um pouco mais sobre o conjunto de dados, vamos ver algumas métricas gerais de resumo do conjunto ratings e entender quantas avaliações os filmes têm e quantas avaliações cada usuário fez.

Dois métodos comuns que vão ajudar você a agregar estatísticas de resumo no Spark são .filter() e .groupBy(). O método .filter() permite filtrar qualquer dado que não atenda aos critérios que você especificar.

Este exercicio faz parte do curso

Construindo mecanismos de recomendação com PySpark

Ver curso

Instruções do exercicio

  • Importe col de pyspark.sql.functions e visualize o conjunto ratings usando .show().
  • Aplique o método .filter() no conjunto ratings com o seguinte filtro entre parênteses para incluir apenas userId menores que 100: col("userId") < 100.
  • Chame o método .groupBy() no conjunto ratings para agrupar os dados por userId. Em seguida, chame o método .count() para ver quantos filmes cada userId avaliou.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
Editar e Executar Código