Statistiche sintetiche su MSD
Familiarizziamo con il sottoinsieme Taste Profile di Million Songs Echo Nest. Per questo corso lo chiameremo semplicemente Million Songs dataset o msd. Ricaviamo il numero di utenti e il numero di brani. Vediamo anche quali brani hanno il maggior numero di riproduzioni in questo sottoinsieme.
Questo esercizio fa parte del corso
Costruire motori di raccomandazione con PySpark
Istruzioni dell'esercizio
- Usa il metodo
.show()per dare un'occhiata ai dati. - Completa il codice per contare il numero di
userIddistinti. Seleziona la colonnauserId, poi chiama.distinct()e.count(). - Ora fai lo stesso per gli
songId, quindi conta il numero disongIddistinti. Seleziona la colonnasongIde chiama.distinct()e.count()su di essa.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Look at the data
msd.____()
# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)
# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)