การเก็บข้อมูลจาก RDD
ในแบบฝึกหัดนี้ จะได้ทำงานกับทั้ง RDD และ DataFrame ใน PySpark โดยมีเป้าหมายเพื่อจัดกลุ่มข้อมูลและทำการรวมผลด้วยทั้งสองวิธี
จะโหลดไฟล์ CSV ที่มีข้อมูลเงินเดือนพนักงานเข้าสู่ PySpark ในรูปแบบ RDD จากนั้นจัดกลุ่มตามระดับประสบการณ์และคำนวณเงินเดือนสูงสุดของแต่ละระดับจาก DataFrame วิธีนี้จะช่วยให้เห็นจุดแข็งของข้อมูลแต่ละรูปแบบได้ชัดเจนยิ่งขึ้น
ชุดข้อมูลที่ใช้เกี่ยวข้องกับเงินเดือนของ Data Scientist ซึ่งเป็นประโยชน์อย่างมากในการวิเคราะห์แนวโน้มตลาด โหลดและปรับมาตรฐานข้อมูลให้แล้ว และใน workspace มี SparkSession ชื่อ spark พร้อมใช้งานแล้วเช่นกัน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
PySpark เบื้องต้น
คำแนะนำการฝึกหัด
- สร้าง RDD จาก DataFrame
- เก็บและแสดงผลลัพธ์ของทั้ง RDD และ DataFrame
- จัดกลุ่มตาม
"experience_level"และคำนวณเงินเดือนสูงสุดของแต่ละกลุ่ม
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____
# Collect and print the results
print(rdd_salaries.____)
# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})
# Show the results
dataframe_results.____