Кэширование DataFrame
Вам поручена задача, которая требует выполнения нескольких операций анализа над одним DataFrame. Вы узнали, что кэширование помогает повысить производительность при повторном использовании DataFrame, и хотите применить эту технику.
Вы будете работать с новым набором данных, содержащим информацию о вылетах авиарейсов. В нём могут встречаться дублирующиеся записи, которые необходимо удалить.
DataFrame departures_df уже определён, однако никакие действия над ним ещё не выполнялись.
Это упражнение является частью курса
Очистка данных с помощью PySpark
Инструкции к упражнению
- Закэшируйте уникальные строки DataFrame
departures_df. - Выполните запрос с подсчётом строк в
departures_dfи обратите внимание на время выполнения операции. - Повторите подсчёт строк ещё раз и оцените разницу во времени при работе с закэшированным DataFrame.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
start_time = time.time()
# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____
# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))
# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))