Kom igångKom igång gratis

Sammanfattande statistik för MSD

Nu ska vi bekanta oss med datadelmängden Million Songs Echo Nest Taste Profile. I den här kursen kallar vi den helt enkelt Million Songs-datamängden eller msd. Vi tar reda på antalet användare och antalet låtar, och tittar även på vilka låtar som har flest spelningar i den här delmängden.

Den här övningen är en del av kursen

Bygg rekommendationsmotorer med PySpark

Visa kurs

Övningsinstruktioner

  • Använd metoden .show() för att se hur datan ser ut.
  • Komplettera koden för att räkna antalet distinkta userId:n. Välj kolumnen userId och anropa sedan .distinct() och .count().
  • Gör nu samma sak för songId:n – räkna alltså antalet distinkta songId:n. Välj kolumnen songId och anropa .distinct() och .count() på den.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Look at the data
msd.____()

# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)

# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)
Redigera och kör kod