เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

รวมทุกอย่างเข้าด้วยกัน II

สร้าง DataFrame ใช้การแปลงข้อมูล แคชไว้ แล้วตรวจสอบว่าถูกแคชแล้วหรือยัง จากนั้นยกเลิกการแคชเพื่อคืนหน่วยความจำ ในแบบฝึกหัดนี้มี spark session เตรียมไว้ให้แล้ว ลองสังเกตผลลัพธ์ของเมธอด .explain() ให้ดีเพื่อทำความเข้าใจว่าเกิดอะไรขึ้น

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

PySpark เบื้องต้น

ดูคอร์ส

คำแนะนำการฝึกหัด

  • แคช DataFrame df
  • อธิบายกระบวนการประมวลผลของ DataFrame agg_result
  • ยกเลิกการแคช DataFrame df หลังจากประมวลผลเสร็จแล้ว

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Cache the DataFrame
df.____

# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()

# Analyze the execution plan
agg_result.____

# Uncache the DataFrame
df.____
แก้ไขและรันโค้ด