MSD – zusammenfassende Statistiken
Lass uns den Echo-Nest-Taste-Profile-Teildatensatz der Million Songs kennenlernen. In diesem Kurs nennen wir ihn einfach das Million-Songs-Dataset oder msd. Bestimme die Anzahl der Nutzer und die Anzahl der Songs. Schau dir außerdem an, welche Songs in diesem Teilset am häufigsten abgespielt wurden.
Diese Übung ist Teil des Kurses
<Kurs>Recommendation Engines mit PySpark erstellen</Kurs>Übungsanweisungen
- Verwende die Methode
.show(), um dir einen Eindruck von den Daten zu verschaffen. - Ergänze den Code, um die Anzahl unterschiedlicher
userIds zu zählen. Wähle die SpalteuserIdaus und rufe anschließend.distinct()und.count()auf. - Mache dasselbe für die
songIds, also zähle die Anzahl unterschiedlichersongIds. Wähle die SpaltesongIdaus und rufe.distinct()und.count()darauf auf.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Look at the data
msd.____()
# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)
# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)