ÎncepețiÎncepe gratuit

Procesarea leneșă în practică

Operațiile de procesare leneșă returnează de obicei în aproximativ același interval de timp, indiferent de cantitatea reală de date. Acest lucru se întâmplă deoarece Spark nu execută nicio transformare până când nu este solicitată o acțiune.

În acest exercițiu, vei defini un DataFrame (aa_dfw_df) și vei adăuga câteva transformări. Observă timpul necesar pentru finalizarea transformărilor atunci când sunt definite față de momentul în care datele sunt efectiv interogate. Diferențele pot fi mici, dar vor fi vizibile. Când lucrezi cu un cluster Spark complet și cu volume mai mari de date, diferența va fi mult mai evidentă.

Acest exercițiu face parte din cursul

Curățarea datelor cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă DataFrame-ul.
  • Adaugă transformarea F.lower() pentru coloana Destination Airport.
  • Afișează DataFrame-ul și observă diferența de timp necesară pentru finalizarea acestei acțiuni.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')

# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))

# Show the DataFrame
____
Editează și rulează codul