Inizia subitoInizia gratis

Prestazioni di importazione dei file

Ti è stato fornito un grande insieme di dati da importare in un DataFrame di Spark. Vuoi testare la differenza di velocità di importazione suddividendo il file.

Hai due tipi di file disponibili: departures_full.txt.gz e departures_xxx.txt.gz dove xxx è 000 - 013. Lo stesso numero di righe è ripartito tra ciascun file.

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Importa il file departures_full.txt.gz e i file departures_xxx.txt.gz in DataFrame separati.
  • Esegui un count su ciascun DataFrame e confronta i tempi di esecuzione.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)

# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))

start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))
Modifica ed esegui il codice