НачатьНачать бесплатно

Методы GroupBy и Filter

Теперь, когда мы немного больше узнали о наборе данных, давайте рассмотрим общие сводные метрики набора данных ratings и посмотрим, сколько оценок получили фильмы и сколько оценок оставил каждый пользователь.

Два распространённых метода, которые помогут вам при вычислении сводной статистики в Spark, — это .filter() и .groupBy(). Метод .filter() позволяет исключить данные, которые не соответствуют заданным критериям.

Это упражнение является частью курса

Построение рекомендательных систем с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Импортируйте col из pyspark.sql.functions и просмотрите набор данных ratings с помощью .show().
  • Примените метод .filter() к набору данных ratings, указав внутри скобок следующее условие для отбора только тех userId, значение которых меньше 100: col("userId") < 100.
  • Вызовите метод .groupBy() для набора данных ratings, чтобы сгруппировать данные по userId. Затем вызовите метод .count(), чтобы узнать, сколько фильмов оценил каждый userId.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
Редактировать и запускать код