ฝึกการแคช: SQL
ในแบบฝึกหัดก่อนหน้า เราได้ศึกษา DataFrame สองตัว ได้แก่ df1 และ df2 (ซึ่งสร้างขึ้นจาก df1) โดยเราลองแคช df1 แต่ไม่ได้แคช df2 ในแบบฝึกหัดนี้ เราจะศึกษาผลของการแคช df2 แต่ไม่แคช df1 แทน
สังเกตเวลาที่แต่ละ action ใช้ไปด้วย เพราะเราจะนำมาเปรียบเทียบกันในแบบฝึกหัดถัดไป action ใดที่เร็วขึ้น และ action ใดที่ช้าลง?
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Introduction to Spark SQL in Python
คำแนะนำการฝึกหัด
- แคช
df2แต่ไม่ต้องแคชdf1 - รัน action แรกบน
df1แล้วรันซ้ำอีกครั้ง จากนั้นรัน action บนdf2แล้วรันซ้ำอีกครั้ง ส่วนนี้เตรียมไว้ให้แล้ว
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Unpersist df1 and df2 and initializes a timer
prep(df1, df2)
# Persist df2 using memory and disk storage level
df2.persist(____)
# Run actions both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)