Об'єднуємо все разом II
Створіть DataFrame, застосуйте перетворення, закешуйте його та перевірте, чи його закешовано. Потім скасуйте кешування, щоб звільнити пам'ять.
Для цієї вправи для вас уже створено сесію spark! Уважно подивіться на результат методу .explain(), щоб зрозуміти, що відбувається!
Ця вправа є частиною курсу
Вступ до PySpark
Інструкції до вправи
- Закешуйте датафрейм
df. - Поясніть обробку датафрейму
agg_result. - Після обробки приберіть кеш для датафрейму
dfза допомогоюunpersist().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Cache the DataFrame
df.____
# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()
# Analyze the execution plan
agg_result.____
# Uncache the DataFrame
df.____