ÎncepețiÎncepe gratuit

Performanța importului de fișiere

Ai primit un set mare de date pe care trebuie să îl imporți într-un DataFrame Spark. Vrei să testezi diferența de viteză la import prin împărțirea fișierului în mai multe bucăți.

Ai la dispoziție două tipuri de fișiere: departures_full.txt.gz și departures_xxx.txt.gz, unde xxx este cuprins între 000 și 013. Același număr de rânduri este distribuit între fiecare fișier.

Acest exercițiu face parte din cursul

Curățarea datelor cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă fișierul departures_full.txt.gz și fișierele departures_xxx.txt.gz în DataFrame-uri separate.
  • Rulează un count pe fiecare DataFrame și compară timpii de execuție.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)

# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))

start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))
Editează și rulează codul