Zacznij terazZacznij za darmo

Statystyki podsumowujące zbioru MSD

Zapoznaj się z podzbiorem danych Million Songs Echo Nest Taste Profile. Na potrzeby tego kursu będziemy go nazywać zbiorem Million Songs lub msd. Sprawdź, ilu jest użytkowników i ile jest piosenek. Zobaczmy też, które piosenki mają największą liczbę odtworzeń w tym podzbiorze.

To ćwiczenie jest częścią kursu

Budowanie silników rekomendacji w PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Użyj metody .show(), aby zobaczyć, jak wyglądają dane.
  • Uzupełnij kod, aby zliczyć liczbę unikalnych wartości userId. Wybierz kolumnę userId, a następnie wywołaj .distinct() i .count().
  • Teraz zrób to samo dla songId – zlicz liczbę unikalnych wartości songId. Wybierz kolumnę songId i wywołaj na niej .distinct() i .count().

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Look at the data
msd.____()

# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)

# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)
Edytuj i uruchom kod