การสร้างโมเดล Regression
จุดเด่นอย่างหนึ่งของโมดูล PySpark ML คือสามารถทดลองใช้อัลกอริทึมต่าง ๆ ได้โดยแทบไม่ต้องแก้โค้ดเลย Random Forest Regression เป็นโมเดล Ensemble แบบง่าย ที่ใช้เทคนิค Bagging ในการฝึก ส่วน Gradient Boosted Trees เป็นโมเดล Ensemble แบบ Tree อีกตัวหนึ่ง ซึ่งใช้แนวทางที่แตกต่างออกไปคือ Boosting ในแบบฝึกหัดนี้ มาฝึกโมเดล GBTRegressor กัน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering with PySpark
คำแนะนำการฝึกหัด
- Import
GBTRegressorจากpyspark.ml.regressionซึ่งเป็นโมดูลเดียวกับRandomForestRegressor - Instantiate
GBTRegressorโดยกำหนดfeaturesColเป็นคอลัมน์เวกเตอร์ของฟีเจอร์ที่ชื่อfeatures,labelColเป็นตัวแปรตามSALESCLOSEPRICEและseedแบบสุ่มเป็น42 - ฝึกโมเดลโดยเรียก
fit()บนgbtพร้อมส่งข้อมูลชุดฝึกtrain_dfเข้าไป
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)