Os métodos GroupBy e Filter
Agora que sabemos um pouco mais sobre o conjunto de dados, vamos ver algumas métricas gerais de resumo do conjunto ratings e entender quantas avaliações os filmes têm e quantas avaliações cada usuário fez.
Dois métodos comuns que vão ajudar você a agregar estatísticas de resumo no Spark são .filter() e .groupBy(). O método .filter() permite filtrar qualquer dado que não atenda aos critérios que você especificar.
Este exercicio faz parte do curso
Construindo mecanismos de recomendação com PySpark
Instruções do exercicio
- Importe
coldepyspark.sql.functionse visualize o conjuntoratingsusando.show(). - Aplique o método
.filter()no conjuntoratingscom o seguinte filtro entre parênteses para incluir apenasuserIdmenores que 100:col("userId") < 100. - Chame o método
.groupBy()no conjuntoratingspara agrupar os dados poruserId. Em seguida, chame o método.count()para ver quantos filmes cadauserIdavaliou.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()