Sammanfattning II
Skapa en DataFrame, tillämpa transformationer, cacha den och kontrollera om den är cachad. Avsluta sedan med att ta bort den från cachen för att frigöra minne.
I den här övningen har en spark-session redan skapats åt dig! Studera noggrant resultatet av metoden .explain() för att förstå vad det innebär!
Den här övningen är en del av kursen
Introduktion till PySpark
Övningsinstruktioner
- Cacha DataFramen
df. - Förklara bearbetningen av DataFramen
agg_result. - Ta bort den cachade DataFramen
dffrån minnet efter bearbetningen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Cache the DataFrame
df.____
# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()
# Analyze the execution plan
agg_result.____
# Uncache the DataFrame
df.____