Тренування кешування: SQL
Раніше ми розглядали два датафрейми: df1 і df2 (який створюється з df1). Ми пробували кешувати df1, але не df2. У цій вправі ми дослідимо наслідки кешування df2, але не df1.
Знову зверніть увагу на час виконання кожної дії. Ми порівняємо їх у наступній вправі. Які завдання виконуються швидше? Які сповільнюються?
Ця вправа є частиною курсу
Вступ до Spark SQL у Python
Інструкції до вправи
- Закешуйте
df2, але неdf1. - Запустіть першу дію на
df1і повторіть її, потім запустіть дію наdf2і також повторіть. Це вже зроблено за вас.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Unpersist df1 and df2 and initializes a timer
prep(df1, df2)
# Persist df2 using memory and disk storage level
df2.persist(____)
# Run actions both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)