Bygga en regressionsmodell
En av fördelarna med PySparks ML-modul är att de flesta algoritmer kan testas och utvärderas utan att man behöver ändra särskilt mycket kod. Random Forest-regression är en relativt enkel ensemblemodell som använder bagging för att träna. En annan trädbaserad ensemblemodell är Gradient Boosted Trees, som i stället använder en teknik kallad boosting. I den här övningen ska du träna en GBTRegressor.
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Importera
GBTRegressorfrånpyspark.ml.regression– samma modul somRandomForestRegressor. - Instansiera
GBTRegressormedfeaturesColsatt till vektorkolumnen för våra särdrag,features,labelColsatt till vår beroende variabel,SALESCLOSEPRICE, och det slumpmässigaseedsatt till42. - Träna modellen genom att anropa
fit()pågbtmed de importerade träningsdata,train_df.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)