НачатьНачать бесплатно

Производительность импорта файлов

Вам предоставлен большой набор данных для загрузки в Spark DataFrame. Чтобы сравнить скорость импорта, попробуйте разбить файл на части.

Доступны два типа файлов: departures_full.txt.gz и departures_xxx.txt.gz, где xxx — значения от 000 до 013. Данные распределены между файлами поровну.

Это упражнение является частью курса

Очистка данных с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Загрузите файл departures_full.txt.gz и файлы departures_xxx.txt.gz в отдельные DataFrame.
  • Выполните подсчёт строк для каждого DataFrame и сравните время выполнения.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)

# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))

start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))
Редактировать и запускать код