Procvičení cachování: SQL
V předchozím cvičení jsme prozkoumali dva dataframy: df1 a df2 (který vznikl z df1). Zkusili jsme cachovat df1, ale ne df2. V tomto cvičení se podíváme na efekty cachování df2 bez cachování df1.
Opět si všímej, jak dlouho trvá každá akce. V dalším cvičení je budeme porovnávat. Které úlohy se zrychlily? Které se zpomalily?
Toto cvičení je součástí kurzu
Úvod do Spark SQL v Pythonu
Pokyny k cvičení
- Cachuj
df2, ale nedf1. - Spusť první akci na
df1a zopakuj ji, pak spusť akci nadf2a zopakuj ji. Tato část je již připravená za tebe.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Unpersist df1 and df2 and initializes a timer
prep(df1, df2)
# Persist df2 using memory and disk storage level
df2.persist(____)
# Run actions both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)