НачатьНачать бесплатно

Группировка в PySpark

Вы уже знакомы с фреймворком dask и его абстракцией DataFrame для выполнения вычислений. Однако, как было показано в видео, в мире больших данных Spark, пожалуй, является более популярным инструментом для обработки данных.

В этом упражнении вы будете использовать пакет PySpark для работы со Spark DataFrame. Данные те же, что и в предыдущих упражнениях: участники Олимпийских игр с 1896 по 2016 год.

Spark DataFrame athlete_events_spark доступен в вашем рабочем пространстве.

Методы, которые вы будете использовать в этом упражнении:

  • .printSchema(): выводит схему Spark DataFrame.
  • .groupBy(): оператор группировки для агрегации.
  • .mean(): вычисляет среднее значение по каждой группе.
  • .show(): отображает результаты.

Это упражнение является частью курса

Введение в дата-инжиниринг

Посмотреть курс

Инструкции к упражнению

  • Узнайте тип объекта athlete_events_spark.
  • Узнайте схему athlete_events_spark.
  • Выведите средний возраст олимпийцев с группировкой по году. Обратите внимание: Spark ещё ничего не вычислил. Такой подход называется отложенными вычислениями (lazy evaluation).
  • Возьмите результат предыдущего шага и вызовите на нём .show(), чтобы вычислить средний возраст.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Print the type of athlete_events_spark
print(____(athlete_events_spark))

# Print the schema of athlete_events_spark
print(athlete_events_spark.____())

# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____))

# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____).____())
Редактировать и запускать код