Тренування кешування: частина 1
У наступних вправах ви попрактикуєтеся з різними способами кешування двох датафреймів.
Датафрейм df1 завантажено з файла CSV. Над ним виконано кілька кроків обробки. Оскільки df1 буде використовуватися більше одного разу, його варто кешувати.
Другий датафрейм df2 створено шляхом додаткових ресурсоємних обчислень на основі df1. Його також варто кешувати.
Оскільки df2 залежить від df1, постає запитання: краще кешувати df1 чи кешувати df2?
У цій вправі ми спробуємо кешувати df1. Зверніть увагу на час виконання кожної дії. Ми порівняємо їх у наступній вправі.
Ця вправа є частиною курсу
Вступ до Spark SQL у Python
Інструкції до вправи
- Закешуйте лише
df1. - Запустіть першу дію на
df1і повторіть її, потім запустіть дію наdf2і також повторіть. Це вже зроблено за вас. - Переконайтеся, чи закешовано
df1.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Unpersists df1 and df2 and initializes a timer
prep(df1, df2)
# Cache df1
____
# Run actions on both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)
# Prove df1 is cached
print(____)