Группировка в PySpark
Вы уже знакомы с фреймворком dask и его абстракцией DataFrame для выполнения вычислений. Однако, как было показано в видео, в мире больших данных Spark, пожалуй, является более популярным инструментом для обработки данных.
В этом упражнении вы будете использовать пакет PySpark для работы со Spark DataFrame. Данные те же, что и в предыдущих упражнениях: участники Олимпийских игр с 1896 по 2016 год.
Spark DataFrame athlete_events_spark доступен в вашем рабочем пространстве.
Методы, которые вы будете использовать в этом упражнении:
.printSchema(): выводит схему Spark DataFrame..groupBy(): оператор группировки для агрегации..mean(): вычисляет среднее значение по каждой группе..show(): отображает результаты.
Это упражнение является частью курса
Введение в дата-инжиниринг
Инструкции к упражнению
- Узнайте тип объекта
athlete_events_spark. - Узнайте схему
athlete_events_spark. - Выведите средний возраст олимпийцев с группировкой по году. Обратите внимание: Spark ещё ничего не вычислил. Такой подход называется отложенными вычислениями (lazy evaluation).
- Возьмите результат предыдущего шага и вызовите на нём
.show(), чтобы вычислить средний возраст.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Print the type of athlete_events_spark
print(____(athlete_events_spark))
# Print the schema of athlete_events_spark
print(athlete_events_spark.____())
# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____))
# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____).____())