Inizia subitoInizia gratis

Creare un modello di regressione

Uno dei grandi vantaggi del modulo ML di PySpark è che puoi provare e testare la maggior parte degli algoritmi senza modificare molto il codice. La Random Forest Regression è un modello ensemble piuttosto semplice, che usa il bagging per l'addestramento. Un altro modello ensemble basato su alberi è Gradient Boosted Trees, che usa un approccio diverso chiamato boosting. In questo esercizio alleniamo un GBTRegressor.

Questo esercizio fa parte del corso

Feature Engineering con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Importa GBTRegressor da pyspark.ml.regression, che è lo stesso modulo di RandomForestRegressor.
  • Istanzia GBTRegressor impostando featuresCol sulla colonna vettoriale delle nostre feature, features, labelCol sulla nostra variabile dipendente, SALESCLOSEPRICE, e il seed casuale a 42.
  • Addestra il modello chiamando fit() su gbt con i dati di training importati, train_df.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
Modifica ed esegui il codice