เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การอนุมาน Schema และการกรองข้อมูล

สมมติว่ามีชุดข้อมูลสำมะโนประชากรที่มีทั้ง header และ schema อยู่แล้ว ลองโหลดชุดข้อมูลนี้และให้ PySpark อนุมาน schema ให้อัตโนมัติ แล้วลองกรองเฉพาะผู้ใหญ่ที่อายุมากกว่า 40 ปีดูว่าผลลัพธ์เป็นอย่างไร

อย่าลืมว่ามี SparkSession ชื่อ spark พร้อมใช้งานอยู่แล้วใน workspace ของคุณ!

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

PySpark เบื้องต้น

ดูคอร์ส

คำแนะนำการฝึกหัด

  • โหลดไฟล์ JSON ชื่อ adults.json
  • กรองข้อมูลให้เหลือเฉพาะผู้ใหญ่ที่มี age มากกว่า 40
  • แสดงผลลัพธ์

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Load the dataframe
census_df = spark.read.json("adults.json")

# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)

# Show the result
____
แก้ไขและรันโค้ด