Öva på caching: SQL
Tidigare undersökte vi två DataFrames: df1 och df2 (som skapas från df1). Vi cachade df1, men inte df2. I den här övningen undersöker vi effekterna av att cacha df2, men inte df1.
Notera återigen hur lång tid varje åtgärd tar. Vi jämför resultaten i nästa övning. Vilka uppgifter går snabbare? Vilka går långsammare?
Den här övningen är en del av kursen
Introduktion till Spark SQL i Python
Övningsinstruktioner
- Cacha
df2, men intedf1. - Kör en första åtgärd på
df1och upprepa den, kör sedan en åtgärd pådf2och upprepa den. Det här har redan gjorts åt dig.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Unpersist df1 and df2 and initializes a timer
prep(df1, df2)
# Persist df2 using memory and disk storage level
df2.persist(____)
# Run actions both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)