เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การรวมกลุ่มข้อมูลแบบซับซ้อน

เพื่อให้คุ้นเคยกับเมธอดสำหรับการรวมกลุ่มข้อมูลที่มีอยู่ใน PySpark มากขึ้น ลองทำการรวมกลุ่มข้อมูลที่ซับซ้อนขึ้นอีกนิดกัน โดยเป้าหมายคือนำคำสั่งทั้งหมดมารวมเป็นบรรทัดเดียว

จำไว้ว่า SparkSession ชื่อ spark และ Spark DataFrame ชื่อ salaries_df ถูกสร้างไว้ใน workspace แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

PySpark เบื้องต้น

ดูคอร์ส

คำแนะนำการฝึกหัด

  • คำนวณเงินเดือนเฉลี่ยของบริษัทขนาดใหญ่ในสหรัฐอเมริกาโดยใช้คอลัมน์ "salary_in_usd"
  • คำนวณเงินเดือนรวมทั้งหมดของบริษัทขนาดใหญ่ในสหรัฐอเมริกา

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Average salaries at large us companies
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US").groupBy().____

#set a large companies variable for other analytics
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US")

# Total salaries in usd
large_companies.groupBy().____.show()
แก้ไขและรันโค้ด