ÎncepețiÎncepe gratuit

Exersăm caching-ul: SQL-ul

Anterior, am analizat două DataFrame-uri: df1 și df2 (creat din df1). Am încercat să facem cache pe df1, dar nu și pe df2. În acest exercițiu, vom examina efectele aplicării cache pe df2, dar nu și pe df1.

Observă din nou cât timp durează fiecare acțiune. Le vom compara în exercițiul următor. Ce operații se execută mai repede? Care devin mai lente?

Acest exercițiu face parte din cursul

Introducere în Spark SQL în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Aplică cache pe df2, dar nu și pe df1.
  • Rulează o primă acțiune pe df1 și repet-o, apoi rulează o acțiune pe df2 și repet-o. Acest lucru a fost deja realizat pentru tine.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Unpersist df1 and df2 and initializes a timer
prep(df1, df2) 

# Persist df2 using memory and disk storage level 
df2.persist(____)

# Run actions both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd") 
run(df2, "df2_1st") 
run(df2, "df2_2nd", elapsed=True)
Editează și rulează codul