Creare un modello di regressione
Uno dei grandi vantaggi del modulo ML di PySpark è che puoi provare e testare la maggior parte degli algoritmi senza modificare molto il codice. La Random Forest Regression è un modello ensemble piuttosto semplice, che usa il bagging per l'addestramento. Un altro modello ensemble basato su alberi è Gradient Boosted Trees, che usa un approccio diverso chiamato boosting. In questo esercizio alleniamo un GBTRegressor.
Questo esercizio fa parte del corso
Feature Engineering con PySpark
Istruzioni dell'esercizio
- Importa
GBTRegressordapyspark.ml.regression, che è lo stesso modulo diRandomForestRegressor. - Istanzia
GBTRegressorimpostandofeaturesColsulla colonna vettoriale delle nostre feature,features,labelColsulla nostra variabile dipendente,SALESCLOSEPRICE, e ilseedcasuale a42. - Addestra il modello chiamando
fit()sugbtcon i dati di training importati,train_df.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)