Zacznij terazZacznij za darmo

Wydajność importu plików

Masz do zaimportowania duży zbiór danych do Spark DataFrame. Chcesz sprawdzić, jak podział pliku wpływa na szybkość importu.

Dysponujesz dwoma typami plików: departures_full.txt.gz oraz departures_xxx.txt.gz, gdzie xxx przyjmuje wartości od 000 do 013. Ta sama liczba wierszy jest rozłożona równomiernie między poszczególne pliki.

To ćwiczenie jest częścią kursu

Czyszczenie danych w PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj plik departures_full.txt.gz oraz pliki departures_xxx.txt.gz do osobnych obiektów DataFrame.
  • Uruchom metodę count na każdym DataFrame i porównaj czasy wykonania.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)

# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))

start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))
Edytuj i uruchom kod