Sammanfattande statistik för MSD
Nu ska vi bekanta oss med datadelmängden Million Songs Echo Nest Taste Profile. I den här kursen kallar vi den helt enkelt Million Songs-datamängden eller msd. Vi tar reda på antalet användare och antalet låtar, och tittar även på vilka låtar som har flest spelningar i den här delmängden.
Den här övningen är en del av kursen
Bygg rekommendationsmotorer med PySpark
Övningsinstruktioner
- Använd metoden
.show()för att se hur datan ser ut. - Komplettera koden för att räkna antalet distinkta
userId:n. Välj kolumnenuserIdoch anropa sedan.distinct()och.count(). - Gör nu samma sak för
songId:n – räkna alltså antalet distinktasongId:n. Välj kolumnensongIdoch anropa.distinct()och.count()på den.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Look at the data
msd.____()
# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)
# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)