รวมทุกอย่างเข้าด้วยกัน II
สร้าง DataFrame ใช้การแปลงข้อมูล แคชไว้ แล้วตรวจสอบว่าถูกแคชแล้วหรือยัง จากนั้นยกเลิกการแคชเพื่อคืนหน่วยความจำ
ในแบบฝึกหัดนี้มี spark session เตรียมไว้ให้แล้ว ลองสังเกตผลลัพธ์ของเมธอด .explain() ให้ดีเพื่อทำความเข้าใจว่าเกิดอะไรขึ้น
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
PySpark เบื้องต้น
คำแนะนำการฝึกหัด
- แคช DataFrame
df - อธิบายกระบวนการประมวลผลของ DataFrame
agg_result - ยกเลิกการแคช DataFrame
dfหลังจากประมวลผลเสร็จแล้ว
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Cache the DataFrame
df.____
# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()
# Analyze the execution plan
agg_result.____
# Uncache the DataFrame
df.____