ПочатиПочніть безкоштовно

Методи GroupBy і Filter

Тепер, коли ви краще розумієте набір даних, подивімося на загальні зведені метрики набору ratings: скільки оцінок мають фільми та скільки оцінок залишив кожен користувач.

Два поширені методи, які стануть у пригоді під час агрегації підсумкової статистики в Spark, — це .filter() і .groupBy(). Метод .filter() дає змогу відфільтрувати дані, які не відповідають заданим критеріям.

Ця вправа є частиною курсу

Створення рушіїв рекомендацій у PySpark

Переглянути курс

Інструкції до вправи

  • Імпортуйте col з pyspark.sql.functions і перегляньте набір даних ratings за допомогою .show().
  • Застосуйте метод .filter() до набору даних ratings з таким фільтром у дужках, щоб залишити лише userId, менші за 100: col("userId") < 100.
  • Викличте метод .groupBy() для набору даних ratings, щоб згрупувати дані за userId. Викличте метод .count(), щоб побачити, скільки фільмів оцінив кожен userId.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
Редагувати та запускати код