LoslegenKostenlos starten

MSD – zusammenfassende Statistiken

Lass uns den Echo-Nest-Taste-Profile-Teildatensatz der Million Songs kennenlernen. In diesem Kurs nennen wir ihn einfach das Million-Songs-Dataset oder msd. Bestimme die Anzahl der Nutzer und die Anzahl der Songs. Schau dir außerdem an, welche Songs in diesem Teilset am häufigsten abgespielt wurden.

Diese Übung ist Teil des Kurses

<Kurs>Recommendation Engines mit PySpark erstellen</Kurs>
Kurs ansehen

Übungsanweisungen

  • Verwende die Methode .show(), um dir einen Eindruck von den Daten zu verschaffen.
  • Ergänze den Code, um die Anzahl unterschiedlicher userIds zu zählen. Wähle die Spalte userId aus und rufe anschließend .distinct() und .count() auf.
  • Mache dasselbe für die songIds, also zähle die Anzahl unterschiedlicher songIds. Wähle die Spalte songId aus und rufe .distinct() und .count() darauf auf.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Look at the data
msd.____()

# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)

# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)
Code bearbeiten und ausführen