Методи GroupBy і Filter
Тепер, коли ви краще розумієте набір даних, подивімося на загальні зведені метрики набору ratings: скільки оцінок мають фільми та скільки оцінок залишив кожен користувач.
Два поширені методи, які стануть у пригоді під час агрегації підсумкової статистики в Spark, — це .filter() і .groupBy(). Метод .filter() дає змогу відфільтрувати дані, які не відповідають заданим критеріям.
Ця вправа є частиною курсу
Створення рушіїв рекомендацій у PySpark
Інструкції до вправи
- Імпортуйте
colзpyspark.sql.functionsі перегляньте набір данихratingsза допомогою.show(). - Застосуйте метод
.filter()до набору данихratingsз таким фільтром у дужках, щоб залишити лишеuserId, менші за 100:col("userId") < 100. - Викличте метод
.groupBy()для набору данихratings, щоб згрупувати дані заuserId. Викличте метод.count(), щоб побачити, скільки фільмів оцінив коженuserId.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()