Performanța importului de fișiere
Ai primit un set mare de date pe care trebuie să îl imporți într-un DataFrame Spark. Vrei să testezi diferența de viteză la import prin împărțirea fișierului în mai multe bucăți.
Ai la dispoziție două tipuri de fișiere: departures_full.txt.gz și departures_xxx.txt.gz, unde xxx este cuprins între 000 și 013. Același număr de rânduri este distribuit între fiecare fișier.
Acest exercițiu face parte din cursul
Curățarea datelor cu PySpark
Instrucțiuni pentru exercițiu
- Importă fișierul
departures_full.txt.gzși fișiereledepartures_xxx.txt.gzîn DataFrame-uri separate. - Rulează un count pe fiecare DataFrame și compară timpii de execuție.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)
# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))
start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))