Een regressiemodel bouwen
Een van de fijne dingen aan de PySpark ML-module is dat je de meeste algoritmen kunt uitproberen zonder veel code te wijzigen. Random Forest Regression is een vrij eenvoudig ensemblemodel dat bagging gebruikt om te fitten. Een ander op bomen gebaseerd ensemblemodel is Gradient Boosted Trees, dat een andere aanpak gebruikt, namelijk boosting. In deze oefening trainen we een GBTRegressor.
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Importeer
GBTRegressoruitpyspark.ml.regression, wat je zult merken hetzelfde modulepad is alsRandomForestRegressor. - Instantieer
GBTRegressormetfeaturesColingesteld op de vector kolom van onze features,features,labelColingesteld op onze afhankelijke variabele,SALESCLOSEPRICE, en de willekeurigeseedop42. - Train het model door
fit()aan te roepen opgbtmet de geïmporteerde trainingsgegevens,train_df.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)