캐싱 연습: SQL
앞서 df1과 df1에서 만들어진 df2라는 두 개의 DataFrame을 살펴봤습니다. 그때는 df1만 캐싱하고 df2는 캐싱하지 않았죠. 이번 연습에서는 반대로 df2를 캐싱하고 df1은 캐싱하지 않았을 때의 효과를 살펴보겠습니다.
각 작업에 걸리는 시간을 다시 기록해 보세요. 다음 연습 문제에서 비교해 볼 예정입니다. 어떤 작업이 더 빨라졌나요? 어떤 작업은 오히려 느려졌나요?
이 연습은 강의의 일부입니다
Python에서 Spark SQL 입문
연습 안내
df1은 캐싱하지 않고df2만 캐싱하세요.df1에서 액션을 한 번 실행하고 반복한 뒤,df2에서도 액션을 실행하고 반복하세요. 이 부분은 미리 작성되어 있습니다.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Unpersist df1 and df2 and initializes a timer
prep(df1, df2)
# Persist df2 using memory and disk storage level
df2.persist(____)
# Run actions both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)