Statystyki podsumowujące zbioru MSD
Zapoznaj się z podzbiorem danych Million Songs Echo Nest Taste Profile. Na potrzeby tego kursu będziemy go nazywać zbiorem Million Songs lub msd. Sprawdź, ilu jest użytkowników i ile jest piosenek. Zobaczmy też, które piosenki mają największą liczbę odtworzeń w tym podzbiorze.
To ćwiczenie jest częścią kursu
Budowanie silników rekomendacji w PySpark
Instrukcje do ćwiczenia
- Użyj metody
.show(), aby zobaczyć, jak wyglądają dane. - Uzupełnij kod, aby zliczyć liczbę unikalnych wartości
userId. Wybierz kolumnęuserId, a następnie wywołaj.distinct()i.count(). - Teraz zrób to samo dla
songId– zlicz liczbę unikalnych wartościsongId. Wybierz kolumnęsongIdi wywołaj na niej.distinct()i.count().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Look at the data
msd.____()
# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)
# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)