Kom igångKom igång gratis

Lat bearbetning i praktiken

Lata bearbetningsoperationer tar ungefär lika lång tid oavsett hur mycket data som faktiskt finns. Det beror på att Spark inte utför några transformationer förrän en åtgärd begärs.

I den här övningen definierar vi en DataFrame (aa_dfw_df) och lägger till ett par transformationer. Lägg märke till hur lång tid transformationerna tar när de definieras jämfört med när data faktiskt hämtas. Skillnaderna kan vara små, men de är märkbara. I ett fullständigt Spark-kluster med större datamängder blir skillnaden betydligt tydligare.

Den här övningen är en del av kursen

Datarensning med PySpark

Visa kurs

Övningsinstruktioner

  • Läs in DataFrame:en.
  • Lägg till transformationen F.lower() på kolumnen Destination Airport.
  • Visa DataFrame:en och notera hur lång tid det tar för åtgärden att slutföras.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')

# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))

# Show the DataFrame
____
Redigera och kör kod