Всё вместе: часть II
Создайте DataFrame, примените к нему преобразования, закэшируйте его и проверьте, выполнено ли кэширование. Затем освободите кэш, чтобы высвободить память.
Для этого упражнения сессия spark уже создана за вас! Внимательно изучите результат метода .explain(), чтобы понять, что происходит!
Это упражнение является частью курса
Введение в PySpark
Инструкции к упражнению
- Закэшируйте DataFrame
df. - Выведите план обработки DataFrame
agg_resultс помощью метода.explain(). - После завершения обработки освободите кэш DataFrame
dfс помощью.unpersist().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Cache the DataFrame
df.____
# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()
# Analyze the execution plan
agg_result.____
# Uncache the DataFrame
df.____