Kom igångKom igång gratis

Öva på caching: del 1

I de kommande övningarna experimenterar du med olika sätt att cacha två DataFrames.

En dataframe df1 läses in från en csv-fil och genomgår flera bearbetningssteg. Eftersom df1 används mer än en gång är den en bra kandidat för caching.

En andra dataframe df2 skapas genom att utföra ytterligare beräkningstunga steg på df1. Den är också en kandidat för caching.

Eftersom df2 är beroende av df1 uppstår frågan: är det bättre att cacha df1 eller df2?

I den här övningen provar vi att cacha df1. Notera hur lång tid varje åtgärd tar – vi jämför dem i nästa övning.

Den här övningen är en del av kursen

Introduktion till Spark SQL i Python

Visa kurs

Övningsinstruktioner

  • Cacha endast df1.
  • Kör en första åtgärd på df1 och upprepa den, kör sedan en åtgärd på df2 och upprepa den. Det här har redan gjorts åt dig.
  • Kontrollera om df1 är cachad.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Unpersists df1 and df2 and initializes a timer
prep(df1, df2) 

# Cache df1
____

# Run actions on both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)

# Prove df1 is cached
print(____)
Redigera och kör kod