НачатьНачать бесплатно

Практика кэширования: SQL

Ранее мы рассматривали два датафрейма: df1 и df2 (созданный на основе df1). Мы пробовали кэшировать df1, но не df2. В этом упражнении мы изучим эффект кэширования df2 без кэширования df1.

Обратите внимание на время выполнения каждого действия — в следующем упражнении мы сравним эти результаты. Какие операции ускоряются, а какие — замедляются?

Это упражнение является частью курса

Введение в Spark SQL на Python

Посмотреть курс

Инструкции к упражнению

  • Закэшируйте df2, но не df1.
  • Выполните первое действие на df1 и повторите его, затем выполните действие на df2 и повторите его. Этот код уже написан за вас.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Unpersist df1 and df2 and initializes a timer
prep(df1, df2) 

# Persist df2 using memory and disk storage level 
df2.persist(____)

# Run actions both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd") 
run(df2, "df2_1st") 
run(df2, "df2_2nd", elapsed=True)
Редактировать и запускать код