Kom igångKom igång gratis

Öva på caching: SQL

Tidigare undersökte vi två DataFrames: df1 och df2 (som skapas från df1). Vi cachade df1, men inte df2. I den här övningen undersöker vi effekterna av att cacha df2, men inte df1.

Notera återigen hur lång tid varje åtgärd tar. Vi jämför resultaten i nästa övning. Vilka uppgifter går snabbare? Vilka går långsammare?

Den här övningen är en del av kursen

Introduktion till Spark SQL i Python

Visa kurs

Övningsinstruktioner

  • Cacha df2, men inte df1.
  • Kör en första åtgärd på df1 och upprepa den, kör sedan en åtgärd på df2 och upprepa den. Det här har redan gjorts åt dig.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Unpersist df1 and df2 and initializes a timer
prep(df1, df2) 

# Persist df2 using memory and disk storage level 
df2.persist(____)

# Run actions both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd") 
run(df2, "df2_1st") 
run(df2, "df2_2nd", elapsed=True)
Redigera och kör kod