MSD-samenvattingsstatistieken
Maak kennis met de Million Songs Echo Nest Taste Profile-deelverzameling. Voor deze cursus noemen we dit gewoon de Million Songs-gegevensset of msd. Laten we het aantal gebruikers en het aantal nummers bepalen. Kijk ook welke nummers in deze subset het vaakst zijn afgespeeld.
Deze oefening maakt deel uit van de cursus
Aanbevelingssystemen bouwen met PySpark
Oefeninstructies
- Gebruik de methode
.show()om te zien hoe de data eruitziet. - Maak de code af om het aantal unieke
userIds te tellen. Selecteer de kolomuserIden roep vervolgens.distinct()en.count()aan. - Doe nu hetzelfde voor de
songIds: tel het aantal uniekesongIds. Selecteer de kolomsongIden roep daarop.distinct()en.count()aan.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Look at the data
msd.____()
# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)
# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)