การกรองข้อมูลตามบริษัท
จากชุดข้อมูลเดิมในแบบฝึกหัดที่แล้ว สมมติว่าต้องการดูเฉพาะตำแหน่งงานระดับเริ่มต้น ("EN") ในแคนาดา ("CA") เงินเดือนในกลุ่มนี้เป็นอย่างไรบ้าง?
จำไว้ว่ามี SparkSession ชื่อ spark พร้อมใช้งานอยู่แล้วใน workspace ของคุณ!
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
PySpark เบื้องต้น
คำแนะนำการฝึกหัด
- กรอง DataFrame ให้เหลือเฉพาะแถวที่
company_locationเป็น"CA" - คำนวณค่าเฉลี่ยของคอลัมน์
salary_in_usd - แสดงผลลัพธ์ที่ได้!
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Average salary for entry level in Canada
CA_jobs = ca_salaries_df.____(ca_salaries_df[____] == "CA").filter(ca_salaries_df['experience_level']
== "EN").groupBy().____("salary_in_usd")
# Show the result
CA_jobs.____()