ПочатиПочніть безкоштовно

Тренування кешування: SQL

Раніше ми розглядали два датафрейми: df1 і df2 (який створюється з df1). Ми пробували кешувати df1, але не df2. У цій вправі ми дослідимо наслідки кешування df2, але не df1.

Знову зверніть увагу на час виконання кожної дії. Ми порівняємо їх у наступній вправі. Які завдання виконуються швидше? Які сповільнюються?

Ця вправа є частиною курсу

Вступ до Spark SQL у Python

Переглянути курс

Інструкції до вправи

  • Закешуйте df2, але не df1.
  • Запустіть першу дію на df1 і повторіть її, потім запустіть дію на df2 і також повторіть. Це вже зроблено за вас.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Unpersist df1 and df2 and initializes a timer
prep(df1, df2) 

# Persist df2 using memory and disk storage level 
df2.persist(____)

# Run actions both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd") 
run(df2, "df2_1st") 
run(df2, "df2_2nd", elapsed=True)
Редагувати та запускати код