Ein Regressionsmodell erstellen
Einer der großen Vorteile des PySpark-ML-Moduls ist, dass sich die meisten Algorithmen ausprobieren und testen lassen, ohne viel Code zu ändern. Random-Forest-Regression ist ein relativ einfaches Ensemble-Modell, das Bagging zum Anpassen nutzt. Ein weiteres baumbasiertes Ensemble-Modell sind Gradient Boosted Trees, die eine andere Methode namens Boosting verwenden. In dieser Übung trainieren wir einen GBTRegressor.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering mit PySpark</Kurs>Übungsanweisungen
- Importiere
GBTRegressorauspyspark.ml.regression. Du wirst sehen, dass es dasselbe Modul ist wieRandomForestRegressor. - Instanziiere
GBTRegressormitfeaturesCol, gesetzt auf die Vektorspalte unserer Merkmale namensfeatures,labelCol, gesetzt auf unsere abhängige VariableSALESCLOSEPRICE, und dem zufälligenseedauf42. - Trainiere das Modell, indem du
fit()aufgbtmit den importierten Trainingsdatentrain_dfaufrufst.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)