Estatísticas resumidas do MSD
Vamos conhecer o subconjunto de dados Million Songs Echo Nest Taste Profile. Para fins deste curso, vamos chamá-lo de Million Songs dataset ou msd. Vamos obter o número de usuários e o número de músicas. Também vamos ver quais músicas têm mais reproduções nesse subconjunto.
Este exercicio faz parte do curso
Construindo mecanismos de recomendação com PySpark
Instruções do exercicio
- Use o método
.show()para ver como são os dados. - Complete o código para contar o número de
userIds distintos. Selecione a colunauserId, depois chame.distinct()e.count(). - Agora faça o mesmo para os
songIds, ou seja, conte o número desongIds distintos. Selecione a colunasongIde chame.distinct()e.count()nela.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Look at the data
msd.____()
# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)
# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)