Prestazioni di importazione dei file
Ti è stato fornito un grande insieme di dati da importare in un DataFrame di Spark. Vuoi testare la differenza di velocità di importazione suddividendo il file.
Hai due tipi di file disponibili: departures_full.txt.gz e departures_xxx.txt.gz dove xxx è 000 - 013. Lo stesso numero di righe è ripartito tra ciascun file.
Questo esercizio fa parte del corso
Pulizia dei dati con PySpark
Istruzioni dell'esercizio
- Importa il file
departures_full.txt.gze i filedepartures_xxx.txt.gzin DataFrame separati. - Esegui un count su ciascun DataFrame e confronta i tempi di esecuzione.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)
# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))
start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))