Побудова регресійної моделі
Одна з переваг модуля PySpark ML у тому, що більшість алгоритмів можна швидко спробувати й перевірити, майже не змінюючи код. Random Forest Regression — це доволі проста ансамблева модель, яка використовує bagging для навчання. Інша деревоподібна ансамблева модель — Gradient Boosted Trees, що застосовує інший підхід, який називається boosting. У цій вправі давайте натренуємо GBTRegressor.
Ця вправа є частиною курсу
Опрацювання ознак у PySpark
Інструкції до вправи
- Імпортуйте
GBTRegressorзpyspark.ml.regression, зверніть увагу, що це той самий модуль, що йRandomForestRegressor. - Створіть екземпляр
GBTRegressor, установившиfeaturesColна векторну колонку ознакfeatures,labelCol— на нашу залежну зміннуSALESCLOSEPRICE, а випадковеseed— на42. - Натренуйте модель, викликавши
fit()дляgbtз імпортованими тренувальними данимиtrain_df.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)