Ćwiczenie z cachowaniem: SQL
Wcześniej przyjrzeliśmy się dwóm DataFrame'om: df1 i df2 (który powstaje na podstawie df1). Próbowaliśmy cachować df1, ale nie df2. W tym ćwiczeniu sprawdzimy, co się dzieje, gdy cachujemy df2, ale nie df1.
Zwróć uwagę na czas wykonania poszczególnych akcji. Porównamy te wyniki w kolejnym ćwiczeniu. Które operacje przyspieszyły? Które spowolniały?
To ćwiczenie jest częścią kursu
Wprowadzenie do Spark SQL w Pythonie
Instrukcje do ćwiczenia
- Cachuj
df2, ale niedf1. - Uruchom pierwszą akcję na
df1i powtórz ją, a następnie uruchom akcję nadf2i również ją powtórz. Ta część została już za ciebie przygotowana.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Unpersist df1 and df2 and initializes a timer
prep(df1, df2)
# Persist df2 using memory and disk storage level
df2.persist(____)
# Run actions both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)