Regression मॉडल बनाना
PySpark ML मॉड्यूल की एक बड़ी खासियत यह है कि ज़्यादातर एल्गोरिदम बिना ज़्यादा कोड बदले ट्राई और टेस्ट किए जा सकते हैं। Random Forest Regression एक काफ़ी सरल एंसेंबल मॉडल है, जो bagging से फिट होता है। एक और ट्री-आधारित एंसेंबल मॉडल Gradient Boosted Trees है, जो boosting नाम के अलग अप्रोच से फिट होता है। इस अभ्यास में आइए एक GBTRegressor ट्रेन करें।
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
pyspark.ml.regressionसेGBTRegressorइम्पोर्ट करें, जो आप देखेंगे किRandomForestRegressorवाले ही मॉड्यूल में है.GBTRegressorको instantiate करें, जहाँfeaturesColहमारे फीचर्स के वेक्टर कॉलमfeaturesपर सेट हो,labelColहमारा dependent वैरिएबलSALESCLOSEPRICEहो, और randomseedको42रखें.- इम्पोर्ट किए गए training डेटा
train_dfके साथgbtपरfit()कॉल करके मॉडल ट्रेन करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)