Random Forest के साथ देरी वाली उड़ानों की भविष्यवाणी
इस अभ्यास में आप cross validation और ensemble मेथड्स को साथ में उपयोग करेंगे. आप देरी वाली उड़ानों की भविष्यवाणी करने के लिए एक Random Forest classifier ट्रेन करेंगे, और मॉडल पैरामीटर्स के लिए सबसे अच्छे मान चुनने के लिए cross validation का उपयोग करेंगे.
आप निम्न पैरामीटर्स के अच्छे मान ढूँढ़ेंगे:
featureSubsetStrategy— हर नोड पर split के लिए कितने फीचर्स पर विचार किया जाए, औरmaxDepth— किसी भी ब्रांच में अधिकतम splits की गहराई.
दुर्भाग्य से यह मॉडल बनाना काफी समय लेता है, इसलिए हम pipeline पर .fit() मेथड नहीं चलाएँगे.
RandomForestClassifier क्लास पहले से ही सेशन में इम्पोर्ट किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Machine Learning
अभ्यास निर्देश
- एक random forest classifier ऑब्जेक्ट बनाएँ.
- एक parameter grid builder ऑब्जेक्ट बनाएँ.
featureSubsetStrategyऔरmaxDepthपैरामीटर्स के लिए ग्रिड पॉइंट्स जोड़ें. - एक binary classification evaluator बनाएँ.
- एक cross-validator ऑब्जेक्ट बनाएँ, जिसमें estimator, parameter grid, और evaluator निर्दिष्ट हों. 5-fold cross validation चुनें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create a random forest classifier
forest = ____()
# Create a parameter grid
params = ____() \
.____(____, ['all', 'onethird', 'sqrt', 'log2']) \
.____(____, [2, 5, 10]) \
.____()
# Create a binary classification evaluator
evaluator = ____()
# Create a cross-validator
cv = ____(____, ____, ____, ____)