Zacznij terazZacznij za darmo

Ćwiczenie z cachowaniem: SQL

Wcześniej przyjrzeliśmy się dwóm DataFrame'om: df1 i df2 (który powstaje na podstawie df1). Próbowaliśmy cachować df1, ale nie df2. W tym ćwiczeniu sprawdzimy, co się dzieje, gdy cachujemy df2, ale nie df1.

Zwróć uwagę na czas wykonania poszczególnych akcji. Porównamy te wyniki w kolejnym ćwiczeniu. Które operacje przyspieszyły? Które spowolniały?

To ćwiczenie jest częścią kursu

Wprowadzenie do Spark SQL w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Cachuj df2, ale nie df1.
  • Uruchom pierwszą akcję na df1 i powtórz ją, a następnie uruchom akcję na df2 i również ją powtórz. Ta część została już za ciebie przygotowana.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Unpersist df1 and df2 and initializes a timer
prep(df1, df2) 

# Persist df2 using memory and disk storage level 
df2.persist(____)

# Run actions both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd") 
run(df2, "df2_1st") 
run(df2, "df2_2nd", elapsed=True)
Edytuj i uruchom kod