एल्गोरिदम का मूल्यांकन और तुलना
अब जब हमने GBTRegressor के साथ एक नया मॉडल बना लिया है, तो इसे अपने बेसलाइन RandomForestRegressor के मुकाबले तुलना करने का समय है। इसके लिए हम दोनों मॉडलों की predictions को वास्तविक डेटा से मिलाएँगे और RMSE तथा R^2 निकालेंगे।
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
pyspark.ml.evaluationसेRegressionEvaluatorइम्पोर्ट करें ताकि इसे आगे उपयोग किया जा सके।RegressionEvaluatorको initialize करें:labelColको हमारे वास्तविक डेटाSALESCLOSEPRICEपर सेट करें औरpredictionColको हमारे predicted डेटाPrediction_Priceपर।- अपने metrics निकालने के लिए,
evaluatorपरevaluateकॉल करें और prediction वैल्यूpredsपास करें। एक dictionary बनाएँ जिसमें keyevaluator.metricNameऔर valuermseहो; यही प्रक्रियाr2metric के लिए भी दोहराएँ।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
from ____ import ____
# Select columns to compute test error
evaluator = ____(____=____,
____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
# Create evaluation metrics
rmse = evaluator.____(____, {____: ____})
r2 = evaluator.____(____, {____: ____})
# Print Model Metrics
print(key + ' RMSE: ' + str(rmse))
print(key + ' R^2: ' + str(r2))