เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ฝึกการแคช: SQL

ในแบบฝึกหัดก่อนหน้า เราได้ศึกษา DataFrame สองตัว ได้แก่ df1 และ df2 (ซึ่งสร้างขึ้นจาก df1) โดยเราลองแคช df1 แต่ไม่ได้แคช df2 ในแบบฝึกหัดนี้ เราจะศึกษาผลของการแคช df2 แต่ไม่แคช df1 แทน

สังเกตเวลาที่แต่ละ action ใช้ไปด้วย เพราะเราจะนำมาเปรียบเทียบกันในแบบฝึกหัดถัดไป action ใดที่เร็วขึ้น และ action ใดที่ช้าลง?

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Introduction to Spark SQL in Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • แคช df2 แต่ไม่ต้องแคช df1
  • รัน action แรกบน df1 แล้วรันซ้ำอีกครั้ง จากนั้นรัน action บน df2 แล้วรันซ้ำอีกครั้ง ส่วนนี้เตรียมไว้ให้แล้ว

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Unpersist df1 and df2 and initializes a timer
prep(df1, df2) 

# Persist df2 using memory and disk storage level 
df2.persist(____)

# Run actions both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd") 
run(df2, "df2_1st") 
run(df2, "df2_2nd", elapsed=True)
แก้ไขและรันโค้ด