НачатьНачать бесплатно

Всё вместе: часть II

Создайте DataFrame, примените к нему преобразования, закэшируйте его и проверьте, выполнено ли кэширование. Затем освободите кэш, чтобы высвободить память. Для этого упражнения сессия spark уже создана за вас! Внимательно изучите результат метода .explain(), чтобы понять, что происходит!

Это упражнение является частью курса

Введение в PySpark

Посмотреть курс

Инструкции к упражнению

  • Закэшируйте DataFrame df.
  • Выведите план обработки DataFrame agg_result с помощью метода .explain().
  • После завершения обработки освободите кэш DataFrame df с помощью .unpersist().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Cache the DataFrame
df.____

# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()

# Analyze the execution plan
agg_result.____

# Uncache the DataFrame
df.____
Редактировать и запускать код