НачатьНачать бесплатно

Типы данных рейтингов

Маркус смотрит много фильмов: документальные, про супергероев, классику и драмы. Опираясь на предыдущий опыт работы со Spark, используйте датафрейм markus_ratings, который содержит данные о том, сколько раз Маркус смотрел фильмы разных жанров. Подумайте, являются ли эти данные неявными или явными рейтингами. Используйте метод groupBy(), чтобы определить, какой жанр имеет наибольший рейтинг — это поможет понять, какие рекомендации ALS может сгенерировать для Маркуса.

Это упражнение является частью курса

Построение рекомендательных систем с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Используйте метод groupBy(), чтобы сгруппировать датафрейм markus_ratings по полю "Genre".
  • Примените метод .sum(), чтобы получить общее количество просмотренных фильмов для каждого жанра.
  • Не забудьте добавить метод .show() в конце, чтобы отобразить результаты.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Group the data by "Genre"
markus_ratings.____("____").____().____()
Редактировать и запускать код