ПочатиПочніть безкоштовно

Кешування DataFrame

Вам доручили завдання, у якому потрібно запустити кілька операцій аналізу для DataFrame. Ви дізналися, що кешування може підвищити продуктивність під час повторного використання DataFrame, і хочете це реалізувати.

Ви працюватимете з новим набором даних із інформацією про відправлення авіарейсів. У ньому можуть бути повтори, тому дані слід дедуплікувати.

DataFrame departures_df уже визначено, але жодних дій ще не виконано.

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Інструкції до вправи

  • Закешуйте унікальні рядки в DataFrame departures_df.
  • Виконайте запит підрахунку для departures_df та зверніть увагу, скільки часу займає операція.
  • Підрахуйте рядки ще раз і порівняйте час виконання для закешованого DataFrame.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

start_time = time.time()

# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____

# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))

# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))
Редагувати та запускати код