Сводная статистика MSD
Познакомимся с подвыборкой данных Million Songs Echo Nest Taste Profile. В рамках этого курса мы будем называть её набором данных Million Songs или msd. Определим количество пользователей и количество песен, а также выясним, какие песни из этой подвыборки прослушивались чаще всего.
Это упражнение является частью курса
Построение рекомендательных систем с помощью PySpark
Инструкции к упражнению
- Используйте метод
.show(), чтобы посмотреть, как выглядят данные. - Дополните код для подсчёта количества уникальных значений
userId. Выберите столбецuserId, затем вызовите.distinct()и.count(). - Сделайте то же самое для
songId: подсчитайте количество уникальных значенийsongId. Выберите столбецsongIdи вызовите на нём.distinct()и.count().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Look at the data
msd.____()
# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)
# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)