Exersăm caching-ul: SQL-ul
Anterior, am analizat două DataFrame-uri: df1 și df2 (creat din df1). Am încercat să facem cache pe df1, dar nu și pe df2. În acest exercițiu, vom examina efectele aplicării cache pe df2, dar nu și pe df1.
Observă din nou cât timp durează fiecare acțiune. Le vom compara în exercițiul următor. Ce operații se execută mai repede? Care devin mai lente?
Acest exercițiu face parte din cursul
Introducere în Spark SQL în Python
Instrucțiuni pentru exercițiu
- Aplică
cachepedf2, dar nu și pedf1. - Rulează o primă acțiune pe
df1și repet-o, apoi rulează o acțiune pedf2și repet-o. Acest lucru a fost deja realizat pentru tine.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Unpersist df1 and df2 and initializes a timer
prep(df1, df2)
# Persist df2 using memory and disk storage level
df2.persist(____)
# Run actions both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)