Inizia subitoInizia gratis

Mettere in cache un DataFrame

Ti è stato assegnato un compito che richiede di eseguire diverse operazioni di analisi su un DataFrame. Hai imparato che la cache può migliorare le prestazioni quando si riutilizzano i DataFrame e vorresti implementarla.

Lavorerai con un nuovo insieme di dati che contiene informazioni sulle partenze aeree. Potrebbe avere dati ripetuti e dovrà essere de-duplicato.

Il DataFrame departures_df è definito, ma non è stata eseguita alcuna action.

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Metti in cache le righe uniche nel DataFrame departures_df.
  • Esegui una query di conteggio su departures_df, annotando quanto tempo richiede l’operazione.
  • Conta di nuovo le righe, osservando la variazione dei tempi su un DataFrame in cache.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

start_time = time.time()

# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____

# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))

# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))
Modifica ed esegui il codice