Procesarea leneșă în practică
Operațiile de procesare leneșă returnează de obicei în aproximativ același interval de timp, indiferent de cantitatea reală de date. Acest lucru se întâmplă deoarece Spark nu execută nicio transformare până când nu este solicitată o acțiune.
În acest exercițiu, vei defini un DataFrame (aa_dfw_df) și vei adăuga câteva transformări. Observă timpul necesar pentru finalizarea transformărilor atunci când sunt definite față de momentul în care datele sunt efectiv interogate. Diferențele pot fi mici, dar vor fi vizibile. Când lucrezi cu un cluster Spark complet și cu volume mai mari de date, diferența va fi mult mai evidentă.
Acest exercițiu face parte din cursul
Curățarea datelor cu PySpark
Instrucțiuni pentru exercițiu
- Încarcă DataFrame-ul.
- Adaugă transformarea
F.lower()pentru coloanaDestination Airport. - Afișează DataFrame-ul și observă diferența de timp necesară pentru finalizarea acestei acțiuni.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')
# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))
# Show the DataFrame
____