Mettere in cache un DataFrame
Ti è stato assegnato un compito che richiede di eseguire diverse operazioni di analisi su un DataFrame. Hai imparato che la cache può migliorare le prestazioni quando si riutilizzano i DataFrame e vorresti implementarla.
Lavorerai con un nuovo insieme di dati che contiene informazioni sulle partenze aeree. Potrebbe avere dati ripetuti e dovrà essere de-duplicato.
Il DataFrame departures_df è definito, ma non è stata eseguita alcuna action.
Questo esercizio fa parte del corso
Pulizia dei dati con PySpark
Istruzioni dell'esercizio
- Metti in cache le righe uniche nel DataFrame
departures_df. - Esegui una query di conteggio su
departures_df, annotando quanto tempo richiede l’operazione. - Conta di nuovo le righe, osservando la variazione dei tempi su un DataFrame in cache.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
start_time = time.time()
# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____
# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))
# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))