LoslegenKostenlos starten

Ein Regressionsmodell erstellen

Einer der großen Vorteile des PySpark-ML-Moduls ist, dass sich die meisten Algorithmen ausprobieren und testen lassen, ohne viel Code zu ändern. Random-Forest-Regression ist ein relativ einfaches Ensemble-Modell, das Bagging zum Anpassen nutzt. Ein weiteres baumbasiertes Ensemble-Modell sind Gradient Boosted Trees, die eine andere Methode namens Boosting verwenden. In dieser Übung trainieren wir einen GBTRegressor.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering mit PySpark</Kurs>
Kurs ansehen

Übungsanweisungen

  • Importiere GBTRegressor aus pyspark.ml.regression. Du wirst sehen, dass es dasselbe Modul ist wie RandomForestRegressor.
  • Instanziiere GBTRegressor mit featuresCol, gesetzt auf die Vektorspalte unserer Merkmale namens features, labelCol, gesetzt auf unsere abhängige Variable SALESCLOSEPRICE, und dem zufälligen seed auf 42.
  • Trainiere das Modell, indem du fit() auf gbt mit den importierten Trainingsdaten train_df aufrufst.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
Code bearbeiten und ausführen