Типы данных рейтингов
Маркус смотрит много фильмов: документальные, про супергероев, классику и драмы. Опираясь на предыдущий опыт работы со Spark, используйте датафрейм markus_ratings, который содержит данные о том, сколько раз Маркус смотрел фильмы разных жанров. Подумайте, являются ли эти данные неявными или явными рейтингами. Используйте метод groupBy(), чтобы определить, какой жанр имеет наибольший рейтинг — это поможет понять, какие рекомендации ALS может сгенерировать для Маркуса.
Это упражнение является частью курса
Построение рекомендательных систем с помощью PySpark
Инструкции к упражнению
- Используйте метод
groupBy(), чтобы сгруппировать датафреймmarkus_ratingsпо полю"Genre". - Примените метод
.sum(), чтобы получить общее количество просмотренных фильмов для каждого жанра. - Не забудьте добавить метод
.show()в конце, чтобы отобразить результаты.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Group the data by "Genre"
markus_ratings.____("____").____().____()