การรวมข้อมูลใน RDD
หลังจากที่ได้วิเคราะห์ข้อมูลด้วย DataFrame ใน PySpark แล้ว มาลองทำงานคล้ายกันด้วย RDD กันบ้าง โดยใช้โค้ดที่เตรียมไว้ให้ คำนวณผลรวมของค่าต่าง ๆ ใน RDD ใน PySpark
มีการสร้าง Spark session ชื่อ spark ไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
PySpark เบื้องต้น
คำแนะนำการฝึกหัด
- สร้าง RDD จาก DataFrame ที่เตรียมไว้ให้
- นำ Lambda function ที่เตรียมไว้ไปใช้กับ key ของ RDD
- เก็บผลลัพธ์ของการรวมข้อมูล
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# DataFrame Creation
data = [("HR", "3000"), ("IT", "4000"), ("Finance", "3500")]
columns = ["Department", "Salary"]
df = spark.createDataFrame(data, schema=columns)
# Map the DataFrame to an RDD
rdd = df.rdd.____(lambda row: (row["Department"], row["Salary"]))
# Apply a lambda function to get the sum of the DataFrame
rdd_aggregated = rdd.____(lambda x, y: x + y)
# Show the collected Results
print(rdd_aggregated.____())