НачатьНачать бесплатно

Сводная статистика MSD

Познакомимся с подвыборкой данных Million Songs Echo Nest Taste Profile. В рамках этого курса мы будем называть её набором данных Million Songs или msd. Определим количество пользователей и количество песен, а также выясним, какие песни из этой подвыборки прослушивались чаще всего.

Это упражнение является частью курса

Построение рекомендательных систем с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Используйте метод .show(), чтобы посмотреть, как выглядят данные.
  • Дополните код для подсчёта количества уникальных значений userId. Выберите столбец userId, затем вызовите .distinct() и .count().
  • Сделайте то же самое для songId: подсчитайте количество уникальных значений songId. Выберите столбец songId и вызовите на нём .distinct() и .count().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Look at the data
msd.____()

# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)

# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)
Редактировать и запускать код