เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การ Aggregate ข้อมูลใน PySpark

ถึงเวลาลองทำ aggregation ด้วยตัวเองแล้ว! เราจะใช้ชุดข้อมูลเงินเดือนที่เคยใช้ไปก่อนหน้านี้ มาดูกันว่าจะสร้าง aggregation อะไรได้บ้าง! มี SparkSession ชื่อ spark และ Spark DataFrame ชื่อ salaries_df เตรียมไว้ให้แล้วใน workspace

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

PySpark เบื้องต้น

ดูคอร์ส

คำแนะนำการฝึกหัด

  • หาเงินเดือนต่ำสุดในบริษัทขนาดเล็ก (Small) ในสหรัฐอเมริกา โดยอ้างอิงคอลัมน์โดยตรง ("salary_in_usd") ไม่ใช่การส่ง SQL string
  • หาเงินเดือนสูงสุดในบริษัทขนาดใหญ่ (Large) ในสหรัฐอเมริกา ซึ่งระบุด้วย "L" โดยอ้างอิงคอลัมน์โดยตรง ("salary_in_usd") ไม่ใช่การส่ง SQL string

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()

# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()
แก้ไขและรันโค้ด