เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การสร้างโมเดล Regression

จุดเด่นอย่างหนึ่งของโมดูล PySpark ML คือสามารถทดลองใช้อัลกอริทึมต่าง ๆ ได้โดยแทบไม่ต้องแก้โค้ดเลย Random Forest Regression เป็นโมเดล Ensemble แบบง่าย ที่ใช้เทคนิค Bagging ในการฝึก ส่วน Gradient Boosted Trees เป็นโมเดล Ensemble แบบ Tree อีกตัวหนึ่ง ซึ่งใช้แนวทางที่แตกต่างออกไปคือ Boosting ในแบบฝึกหัดนี้ มาฝึกโมเดล GBTRegressor กัน

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import GBTRegressor จาก pyspark.ml.regression ซึ่งเป็นโมดูลเดียวกับ RandomForestRegressor
  • Instantiate GBTRegressor โดยกำหนด featuresCol เป็นคอลัมน์เวกเตอร์ของฟีเจอร์ที่ชื่อ features, labelCol เป็นตัวแปรตาม SALESCLOSEPRICE และ seed แบบสุ่มเป็น 42
  • ฝึกโมเดลโดยเรียก fit() บน gbt พร้อมส่งข้อมูลชุดฝึก train_df เข้าไป

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
แก้ไขและรันโค้ด