การ Aggregate ข้อมูลใน PySpark
ถึงเวลาลองทำ aggregation ด้วยตัวเองแล้ว!
เราจะใช้ชุดข้อมูลเงินเดือนที่เคยใช้ไปก่อนหน้านี้ มาดูกันว่าจะสร้าง aggregation อะไรได้บ้าง!
มี SparkSession ชื่อ spark และ Spark DataFrame ชื่อ salaries_df เตรียมไว้ให้แล้วใน workspace
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
PySpark เบื้องต้น
คำแนะนำการฝึกหัด
- หาเงินเดือนต่ำสุดในบริษัทขนาดเล็ก (Small) ในสหรัฐอเมริกา โดยอ้างอิงคอลัมน์โดยตรง (
"salary_in_usd") ไม่ใช่การส่ง SQL string - หาเงินเดือนสูงสุดในบริษัทขนาดใหญ่ (Large) ในสหรัฐอเมริกา ซึ่งระบุด้วย
"L"โดยอ้างอิงคอลัมน์โดยตรง ("salary_in_usd") ไม่ใช่การส่ง SQL string
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()
# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()