शुरू करेंमुफ़्त में शुरू करें

Regression मॉडल बनाना

PySpark ML मॉड्यूल की एक बड़ी खासियत यह है कि ज़्यादातर एल्गोरिदम बिना ज़्यादा कोड बदले ट्राई और टेस्ट किए जा सकते हैं। Random Forest Regression एक काफ़ी सरल एंसेंबल मॉडल है, जो bagging से फिट होता है। एक और ट्री-आधारित एंसेंबल मॉडल Gradient Boosted Trees है, जो boosting नाम के अलग अप्रोच से फिट होता है। इस अभ्यास में आइए एक GBTRegressor ट्रेन करें।

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • pyspark.ml.regression से GBTRegressor इम्पोर्ट करें, जो आप देखेंगे कि RandomForestRegressor वाले ही मॉड्यूल में है.
  • GBTRegressor को instantiate करें, जहाँ featuresCol हमारे फीचर्स के वेक्टर कॉलम features पर सेट हो, labelCol हमारा dependent वैरिएबल SALESCLOSEPRICE हो, और random seed को 42 रखें.
  • इम्पोर्ट किए गए training डेटा train_df के साथ gbt पर fit() कॉल करके मॉडल ट्रेन करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
कोड संपादित करें और चलाएँ