Construir un modelo de regresión
Una de las grandes ventajas del módulo ML de PySpark es que puedes probar la mayoría de algoritmos sin cambiar mucho código. Random Forest Regression es un modelo de conjunto bastante sencillo que usa bagging para el ajuste. Otro modelo de conjunto basado en árboles es Gradient Boosted Trees, que utiliza un enfoque distinto llamado boosting para ajustar. En este ejercicio, vamos a entrenar un GBTRegressor.
Este ejercicio forma parte del curso
Ingeniería de características con PySpark
Instrucciones del ejercicio
- Importa
GBTRegressordesdepyspark.ml.regression, que verás que es el mismo módulo queRandomForestRegressor. - Instancia
GBTRegressorconfeaturesColestablecido a la columna vector de nuestras características,features,labelColestablecido a nuestra variable dependiente,SALESCLOSEPRICE, y laseedaleatoria en42. - Entrena el modelo llamando a
fit()sobregbtcon los datos de entrenamiento importados,train_df.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)