Aan de slagBegin gratis

MSD-samenvattingsstatistieken

Maak kennis met de Million Songs Echo Nest Taste Profile-deelverzameling. Voor deze cursus noemen we dit gewoon de Million Songs-gegevensset of msd. Laten we het aantal gebruikers en het aantal nummers bepalen. Kijk ook welke nummers in deze subset het vaakst zijn afgespeeld.

Deze oefening maakt deel uit van de cursus

Aanbevelingssystemen bouwen met PySpark

Bekijk cursus

Oefeninstructies

  • Gebruik de methode .show() om te zien hoe de data eruitziet.
  • Maak de code af om het aantal unieke userIds te tellen. Selecteer de kolom userId en roep vervolgens .distinct() en .count() aan.
  • Doe nu hetzelfde voor de songIds: tel het aantal unieke songIds. Selecteer de kolom songId en roep daarop .distinct() en .count() aan.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Look at the data
msd.____()

# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)

# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)
Code bewerken en uitvoeren