1. Learn
  2. /
  3. Курси
  4. /
  5. Очищення даних у PySpark

Connected

Вправа

Продуктивність імпорту файлів

Вам надали великий набір даних для імпорту в датафрейм Spark. Ви хочете перевірити різницю у швидкості імпорту, розбивши файл на частини.

У вас є два типи файлів: departures_full.txt.gz та departures_xxx.txt.gz, де xxx — це 000 – 013. Однакова кількість рядків розподілена між кожним файлом.

Інструкції

100 XP
  • Імпортуйте файл departures_full.txt.gz та файли departures_xxx.txt.gz у окремі датафрейми.
  • Запустіть підрахунок кількості рядків у кожному датафреймі та порівняйте час виконання.