Aan de slagBegin gratis

Een regressiemodel bouwen

Een van de fijne dingen aan de PySpark ML-module is dat je de meeste algoritmen kunt uitproberen zonder veel code te wijzigen. Random Forest Regression is een vrij eenvoudig ensemblemodel dat bagging gebruikt om te fitten. Een ander op bomen gebaseerd ensemblemodel is Gradient Boosted Trees, dat een andere aanpak gebruikt, namelijk boosting. In deze oefening trainen we een GBTRegressor.

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Importeer GBTRegressor uit pyspark.ml.regression, wat je zult merken hetzelfde modulepad is als RandomForestRegressor.
  • Instantieer GBTRegressor met featuresCol ingesteld op de vector kolom van onze features, features, labelCol ingesteld op onze afhankelijke variabele, SALESCLOSEPRICE, en de willekeurige seed op 42.
  • Train het model door fit() aan te roepen op gbt met de geïmporteerde trainingsgegevens, train_df.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
Code bewerken en uitvoeren