การอนุมาน Schema และการกรองข้อมูล
สมมติว่ามีชุดข้อมูลสำมะโนประชากรที่มีทั้ง header และ schema อยู่แล้ว ลองโหลดชุดข้อมูลนี้และให้ PySpark อนุมาน schema ให้อัตโนมัติ แล้วลองกรองเฉพาะผู้ใหญ่ที่อายุมากกว่า 40 ปีดูว่าผลลัพธ์เป็นอย่างไร
อย่าลืมว่ามี SparkSession ชื่อ spark พร้อมใช้งานอยู่แล้วใน workspace ของคุณ!
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
PySpark เบื้องต้น
คำแนะนำการฝึกหัด
- โหลดไฟล์ JSON ชื่อ
adults.json - กรองข้อมูลให้เหลือเฉพาะผู้ใหญ่ที่มี
ageมากกว่า40 - แสดงผลลัพธ์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load the dataframe
census_df = spark.read.json("adults.json")
# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)
# Show the result
____