Практика кэширования: SQL
Ранее мы рассматривали два датафрейма: df1 и df2 (созданный на основе df1). Мы пробовали кэшировать df1, но не df2. В этом упражнении мы изучим эффект кэширования df2 без кэширования df1.
Обратите внимание на время выполнения каждого действия — в следующем упражнении мы сравним эти результаты. Какие операции ускоряются, а какие — замедляются?
Это упражнение является частью курса
Введение в Spark SQL на Python
Инструкции к упражнению
- Закэшируйте
df2, но неdf1. - Выполните первое действие на
df1и повторите его, затем выполните действие наdf2и повторите его. Этот код уже написан за вас.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Unpersist df1 and df2 and initializes a timer
prep(df1, df2)
# Persist df2 using memory and disk storage level
df2.persist(____)
# Run actions both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)