Začněte nyníZačněte zdarma

Sestavení regresního modelu

Jednou z velkých výhod modulu PySpark ML je, že většinu algoritmů lze vyzkoušet a otestovat bez větších změn v kódu. Random Forest Regression je poměrně jednoduchý ansámblový model, který k trénování využívá metodu bagging. Dalším stromovým ansámblovým modelem jsou Gradient Boosted Trees, které používají odlišný přístup zvaný boosting. V tomto cvičení natrénuješ model GBTRegressor.

Toto cvičení je součástí kurzu

Feature Engineering with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Importuj GBTRegressor z modulu pyspark.ml.regression – všimni si, že jde o stejný modul jako u RandomForestRegressor.
  • Vytvoř instanci GBTRegressor s parametrem featuresCol nastaveným na sloupcový vektor příznaků s názvem features, parametrem labelCol nastaveným na závislou proměnnou SALESCLOSEPRICE a náhodným seed s hodnotou 42.
  • Natrénuj model voláním fit() na objektu gbt s trénovacími daty train_df.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
Upravit a spustit kód