ПочатиПочніть безкоштовно

Продуктивність імпорту файлів

Вам надали великий набір даних для імпорту в датафрейм Spark. Ви хочете перевірити різницю у швидкості імпорту, розбивши файл на частини.

У вас є два типи файлів: departures_full.txt.gz та departures_xxx.txt.gz, де xxx — це 000013. Однакова кількість рядків розподілена між кожним файлом.

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Інструкції до вправи

  • Імпортуйте файл departures_full.txt.gz та файли departures_xxx.txt.gz у окремі датафрейми.
  • Запустіть підрахунок кількості рядків у кожному датафреймі та порівняйте час виконання.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)

# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))

start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))
Редагувати та запускати код