เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การเก็บข้อมูลจาก RDD

ในแบบฝึกหัดนี้ จะได้ทำงานกับทั้ง RDD และ DataFrame ใน PySpark โดยมีเป้าหมายเพื่อจัดกลุ่มข้อมูลและทำการรวมผลด้วยทั้งสองวิธี

จะโหลดไฟล์ CSV ที่มีข้อมูลเงินเดือนพนักงานเข้าสู่ PySpark ในรูปแบบ RDD จากนั้นจัดกลุ่มตามระดับประสบการณ์และคำนวณเงินเดือนสูงสุดของแต่ละระดับจาก DataFrame วิธีนี้จะช่วยให้เห็นจุดแข็งของข้อมูลแต่ละรูปแบบได้ชัดเจนยิ่งขึ้น

ชุดข้อมูลที่ใช้เกี่ยวข้องกับเงินเดือนของ Data Scientist ซึ่งเป็นประโยชน์อย่างมากในการวิเคราะห์แนวโน้มตลาด โหลดและปรับมาตรฐานข้อมูลให้แล้ว และใน workspace มี SparkSession ชื่อ spark พร้อมใช้งานแล้วเช่นกัน

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

PySpark เบื้องต้น

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง RDD จาก DataFrame
  • เก็บและแสดงผลลัพธ์ของทั้ง RDD และ DataFrame
  • จัดกลุ่มตาม "experience_level" และคำนวณเงินเดือนสูงสุดของแต่ละกลุ่ม

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____

# Collect and print the results
print(rdd_salaries.____)

# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})

# Show the results
dataframe_results.____
แก้ไขและรันโค้ด