Sestavení regresního modelu
Jednou z velkých výhod modulu PySpark ML je, že většinu algoritmů lze vyzkoušet a otestovat bez větších změn v kódu. Random Forest Regression je poměrně jednoduchý ansámblový model, který k trénování využívá metodu bagging. Dalším stromovým ansámblovým modelem jsou Gradient Boosted Trees, které používají odlišný přístup zvaný boosting. V tomto cvičení natrénuješ model GBTRegressor.
Toto cvičení je součástí kurzu
Feature Engineering with PySpark
Pokyny k cvičení
- Importuj
GBTRegressorz modulupyspark.ml.regression– všimni si, že jde o stejný modul jako uRandomForestRegressor. - Vytvoř instanci
GBTRegressors parametremfeaturesColnastaveným na sloupcový vektor příznaků s názvemfeatures, parametremlabelColnastaveným na závislou proměnnouSALESCLOSEPRICEa náhodnýmseeds hodnotou42. - Natrénuj model voláním
fit()na objektugbts trénovacími datytrain_df.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)