Kom igångKom igång gratis

Bygga en regressionsmodell

En av fördelarna med PySparks ML-modul är att de flesta algoritmer kan testas och utvärderas utan att man behöver ändra särskilt mycket kod. Random Forest-regression är en relativt enkel ensemblemodell som använder bagging för att träna. En annan trädbaserad ensemblemodell är Gradient Boosted Trees, som i stället använder en teknik kallad boosting. I den här övningen ska du träna en GBTRegressor.

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Importera GBTRegressor från pyspark.ml.regression – samma modul som RandomForestRegressor.
  • Instansiera GBTRegressor med featuresCol satt till vektorkolumnen för våra särdrag, features, labelCol satt till vår beroende variabel, SALESCLOSEPRICE, och det slumpmässiga seed satt till 42.
  • Träna modellen genom att anropa fit()gbt med de importerade träningsdata, train_df.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
Redigera och kör kod