EmpezarEmpieza gratis

Construir un modelo de regresión

Una de las grandes ventajas del módulo ML de PySpark es que puedes probar la mayoría de algoritmos sin cambiar mucho código. Random Forest Regression es un modelo de conjunto bastante sencillo que usa bagging para el ajuste. Otro modelo de conjunto basado en árboles es Gradient Boosted Trees, que utiliza un enfoque distinto llamado boosting para ajustar. En este ejercicio, vamos a entrenar un GBTRegressor.

Este ejercicio forma parte del curso

Ingeniería de características con PySpark

Ver curso

Instrucciones del ejercicio

  • Importa GBTRegressor desde pyspark.ml.regression, que verás que es el mismo módulo que RandomForestRegressor.
  • Instancia GBTRegressor con featuresCol establecido a la columna vector de nuestras características, features, labelCol establecido a nuestra variable dependiente, SALESCLOSEPRICE, y la seed aleatoria en 42.
  • Entrena el modelo llamando a fit() sobre gbt con los datos de entrenamiento importados, train_df.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
Editar y ejecutar código