Методы GroupBy и Filter
Теперь, когда мы немного больше узнали о наборе данных, давайте рассмотрим общие сводные метрики набора данных ratings и посмотрим, сколько оценок получили фильмы и сколько оценок оставил каждый пользователь.
Два распространённых метода, которые помогут вам при вычислении сводной статистики в Spark, — это .filter() и .groupBy(). Метод .filter() позволяет исключить данные, которые не соответствуют заданным критериям.
Это упражнение является частью курса
Построение рекомендательных систем с помощью PySpark
Инструкции к упражнению
- Импортируйте
colизpyspark.sql.functionsи просмотрите набор данныхratingsс помощью.show(). - Примените метод
.filter()к набору данныхratings, указав внутри скобок следующее условие для отбора только техuserId, значение которых меньше 100:col("userId") < 100. - Вызовите метод
.groupBy()для набора данныхratings, чтобы сгруппировать данные поuserId. Затем вызовите метод.count(), чтобы узнать, сколько фильмов оценил каждыйuserId.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()