ПочатиПочніть безкоштовно

Побудова регресійної моделі

Одна з переваг модуля PySpark ML у тому, що більшість алгоритмів можна швидко спробувати й перевірити, майже не змінюючи код. Random Forest Regression — це доволі проста ансамблева модель, яка використовує bagging для навчання. Інша деревоподібна ансамблева модель — Gradient Boosted Trees, що застосовує інший підхід, який називається boosting. У цій вправі давайте натренуємо GBTRegressor.

Ця вправа є частиною курсу

Опрацювання ознак у PySpark

Переглянути курс

Інструкції до вправи

  • Імпортуйте GBTRegressor з pyspark.ml.regression, зверніть увагу, що це той самий модуль, що й RandomForestRegressor.
  • Створіть екземпляр GBTRegressor, установивши featuresCol на векторну колонку ознак features, labelCol — на нашу залежну змінну SALESCLOSEPRICE, а випадкове seed — на 42.
  • Натренуйте модель, викликавши fit() для gbt з імпортованими тренувальними даними train_df.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
Редагувати та запускати код