Lat bearbetning i praktiken
Lata bearbetningsoperationer tar ungefär lika lång tid oavsett hur mycket data som faktiskt finns. Det beror på att Spark inte utför några transformationer förrän en åtgärd begärs.
I den här övningen definierar vi en DataFrame (aa_dfw_df) och lägger till ett par transformationer. Lägg märke till hur lång tid transformationerna tar när de definieras jämfört med när data faktiskt hämtas. Skillnaderna kan vara små, men de är märkbara. I ett fullständigt Spark-kluster med större datamängder blir skillnaden betydligt tydligare.
Den här övningen är en del av kursen
Datarensning med PySpark
Övningsinstruktioner
- Läs in DataFrame:en.
- Lägg till transformationen
F.lower()på kolumnenDestination Airport. - Visa DataFrame:en och notera hur lång tid det tar för åtgärden att slutföras.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')
# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))
# Show the DataFrame
____