Inizia subitoInizia gratis

Uso dell'elaborazione lazy

Le operazioni di elaborazione lazy in genere restituiscono il risultato in tempi simili indipendentemente dalla quantità effettiva di dati. Ricorda che questo succede perché Spark non esegue alcuna trasformazione finché non viene richiesta un'azione.

In questo esercizio, definiremo un Data Frame (aa_dfw_df) e aggiungeremo un paio di trasformazioni. Nota il tempo necessario per completare le trasformazioni quando vengono definite rispetto a quando i dati vengono effettivamente interrogati. Queste differenze possono essere minime, ma saranno percepibili. Quando lavori con un cluster Spark completo e quantità di dati maggiori, la differenza sarà più evidente.

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Carica il Data Frame.
  • Aggiungi la trasformazione F.lower() alla colonna Destination Airport.
  • Mostra il Data Frame, facendo attenzione alla differenza di tempo necessaria per completare questa azione.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')

# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))

# Show the DataFrame
____
Modifica ed esegui il codice