Производительность импорта файлов
Вам предоставлен большой набор данных для загрузки в Spark DataFrame. Чтобы сравнить скорость импорта, попробуйте разбить файл на части.
Доступны два типа файлов: departures_full.txt.gz и departures_xxx.txt.gz, где xxx — значения от 000 до 013. Данные распределены между файлами поровну.
Это упражнение является частью курса
Очистка данных с помощью PySpark
Инструкции к упражнению
- Загрузите файл
departures_full.txt.gzи файлыdepartures_xxx.txt.gzв отдельные DataFrame. - Выполните подсчёт строк для каждого DataFrame и сравните время выполнения.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)
# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))
start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))