Кешування DataFrame
Вам доручили завдання, у якому потрібно запустити кілька операцій аналізу для DataFrame. Ви дізналися, що кешування може підвищити продуктивність під час повторного використання DataFrame, і хочете це реалізувати.
Ви працюватимете з новим набором даних із інформацією про відправлення авіарейсів. У ньому можуть бути повтори, тому дані слід дедуплікувати.
DataFrame departures_df уже визначено, але жодних дій ще не виконано.
Ця вправа є частиною курсу
Очищення даних у PySpark
Інструкції до вправи
- Закешуйте унікальні рядки в DataFrame
departures_df. - Виконайте запит підрахунку для
departures_dfта зверніть увагу, скільки часу займає операція. - Підрахуйте рядки ще раз і порівняйте час виконання для закешованого DataFrame.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
start_time = time.time()
# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____
# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))
# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))