MSD özet istatistikleri
Million Songs Echo Nest Taste Profile veri alt kümesine alışalım. Bu kurs kapsamında buna kısaca Million Songs veri kümesi ya da msd diyeceğiz. Haydi kullanıcı sayısını ve şarkı sayısını bulalım. Ayrıca bu alt kümede en çok çalınan şarkıların hangileri olduğuna bakalım.
Bu egzersiz, kursun bir parçasıdır
PySpark ile Öneri Motorları Oluşturma
Egzersiz talimatları
- Verinin nasıl göründüğünü görmek için
.show()metodunu kullan. - Farklı
userIdsayılarını hesaplamak için kodu tamamla.userIdsütununu seç, ardından.distinct()ve.count()çağır. - Şimdi aynı şeyi
songIdler için yap: farklısongIdsayılarını hesapla.songIdsütununu seç ve üzerinde.distinct()ile.count()çağır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Look at the data
msd.____()
# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)
# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)