Öva på caching: del 1
I de kommande övningarna experimenterar du med olika sätt att cacha två DataFrames.
En dataframe df1 läses in från en csv-fil och genomgår flera bearbetningssteg. Eftersom df1 används mer än en gång är den en bra kandidat för caching.
En andra dataframe df2 skapas genom att utföra ytterligare beräkningstunga steg på df1. Den är också en kandidat för caching.
Eftersom df2 är beroende av df1 uppstår frågan: är det bättre att cacha df1 eller df2?
I den här övningen provar vi att cacha df1. Notera hur lång tid varje åtgärd tar – vi jämför dem i nästa övning.
Den här övningen är en del av kursen
Introduktion till Spark SQL i Python
Övningsinstruktioner
- Cacha endast
df1. - Kör en första åtgärd på
df1och upprepa den, kör sedan en åtgärd pådf2och upprepa den. Det här har redan gjorts åt dig. - Kontrollera om
df1är cachad.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Unpersists df1 and df2 and initializes a timer
prep(df1, df2)
# Cache df1
____
# Run actions on both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)
# Prove df1 is cached
print(____)