НачатьНачать бесплатно

Кэширование DataFrame

Вам поручена задача, которая требует выполнения нескольких операций анализа над одним DataFrame. Вы узнали, что кэширование помогает повысить производительность при повторном использовании DataFrame, и хотите применить эту технику.

Вы будете работать с новым набором данных, содержащим информацию о вылетах авиарейсов. В нём могут встречаться дублирующиеся записи, которые необходимо удалить.

DataFrame departures_df уже определён, однако никакие действия над ним ещё не выполнялись.

Это упражнение является частью курса

Очистка данных с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Закэшируйте уникальные строки DataFrame departures_df.
  • Выполните запрос с подсчётом строк в departures_df и обратите внимание на время выполнения операции.
  • Повторите подсчёт строк ещё раз и оцените разницу во времени при работе с закэшированным DataFrame.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

start_time = time.time()

# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____

# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))

# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))
Редактировать и запускать код