ПочатиПочніть безкоштовно

Групування в PySpark

Ви вже бачили, як використовувати фреймворк dask і його абстракцію DataFrame для обчислень. Однак, як було показано у відео, у світі великих даних для обробки даних частіше обирають Spark.

У цій вправі ви використаєте пакет PySpark для роботи зі Spark DataFrame. Дані ті самі, що й у попередніх вправах: учасники Олімпійських змагань з 1896 до 2016 року.

У вашому робочому середовищі доступний Spark DataFrame athlete_events_spark.

Методи, які ви використаєте у цій вправі:

  • .printSchema(): допомагає вивести схему Spark DataFrame.
  • .groupBy(): групування для агрегації.
  • .mean(): обчислює середнє в кожній групі.
  • .show(): показує результати.

Ця вправа є частиною курсу

Вступ до Data Engineering

Переглянути курс

Інструкції до вправи

  • Дізнайтеся тип об'єкта athlete_events_spark.
  • Перегляньте схему athlete_events_spark.
  • Виведіть середній вік олімпійців, згрупований за роком. Зверніть увагу, що Spark ще нічого не обчислив. Це називається відкладеним обчисленням (lazy evaluation).
  • Візьміть попередній результат і викличте на ньому .show(), щоб обчислити середній вік.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Print the type of athlete_events_spark
print(____(athlete_events_spark))

# Print the schema of athlete_events_spark
print(athlete_events_spark.____())

# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____))

# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____).____())
Редагувати та запускати код