Comece agoraComece grátis

Estatísticas resumidas do MSD

Vamos conhecer o subconjunto de dados Million Songs Echo Nest Taste Profile. Para fins deste curso, vamos chamá-lo de Million Songs dataset ou msd. Vamos obter o número de usuários e o número de músicas. Também vamos ver quais músicas têm mais reproduções nesse subconjunto.

Este exercicio faz parte do curso

Construindo mecanismos de recomendação com PySpark

Ver curso

Instruções do exercicio

  • Use o método .show() para ver como são os dados.
  • Complete o código para contar o número de userIds distintos. Selecione a coluna userId, depois chame .distinct() e .count().
  • Agora faça o mesmo para os songIds, ou seja, conte o número de songIds distintos. Selecione a coluna songId e chame .distinct() e .count() nela.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Look at the data
msd.____()

# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)

# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)
Editar e Executar Código