Групування в PySpark
Ви вже бачили, як використовувати фреймворк dask і його абстракцію DataFrame для обчислень. Однак, як було показано у відео, у світі великих даних для обробки даних частіше обирають Spark.
У цій вправі ви використаєте пакет PySpark для роботи зі Spark DataFrame. Дані ті самі, що й у попередніх вправах: учасники Олімпійських змагань з 1896 до 2016 року.
У вашому робочому середовищі доступний Spark DataFrame athlete_events_spark.
Методи, які ви використаєте у цій вправі:
.printSchema(): допомагає вивести схему Spark DataFrame..groupBy(): групування для агрегації..mean(): обчислює середнє в кожній групі..show(): показує результати.
Ця вправа є частиною курсу
Вступ до Data Engineering
Інструкції до вправи
- Дізнайтеся тип об'єкта
athlete_events_spark. - Перегляньте схему
athlete_events_spark. - Виведіть середній вік олімпійців, згрупований за роком. Зверніть увагу, що Spark ще нічого не обчислив. Це називається відкладеним обчисленням (lazy evaluation).
- Візьміть попередній результат і викличте на ньому
.show(), щоб обчислити середній вік.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Print the type of athlete_events_spark
print(____(athlete_events_spark))
# Print the schema of athlete_events_spark
print(athlete_events_spark.____())
# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____))
# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____).____())