शुरू करेंमुफ़्त में शुरू करें

Random Forest के साथ देरी वाली उड़ानों की भविष्यवाणी

इस अभ्यास में आप cross validation और ensemble मेथड्स को साथ में उपयोग करेंगे. आप देरी वाली उड़ानों की भविष्यवाणी करने के लिए एक Random Forest classifier ट्रेन करेंगे, और मॉडल पैरामीटर्स के लिए सबसे अच्छे मान चुनने के लिए cross validation का उपयोग करेंगे.

आप निम्न पैरामीटर्स के अच्छे मान ढूँढ़ेंगे:

  • featureSubsetStrategy — हर नोड पर split के लिए कितने फीचर्स पर विचार किया जाए, और
  • maxDepth — किसी भी ब्रांच में अधिकतम splits की गहराई.

दुर्भाग्य से यह मॉडल बनाना काफी समय लेता है, इसलिए हम pipeline पर .fit() मेथड नहीं चलाएँगे.

RandomForestClassifier क्लास पहले से ही सेशन में इम्पोर्ट किया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Machine Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • एक random forest classifier ऑब्जेक्ट बनाएँ.
  • एक parameter grid builder ऑब्जेक्ट बनाएँ. featureSubsetStrategy और maxDepth पैरामीटर्स के लिए ग्रिड पॉइंट्स जोड़ें.
  • एक binary classification evaluator बनाएँ.
  • एक cross-validator ऑब्जेक्ट बनाएँ, जिसमें estimator, parameter grid, और evaluator निर्दिष्ट हों. 5-fold cross validation चुनें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create a random forest classifier
forest = ____()

# Create a parameter grid
params = ____() \
            .____(____, ['all', 'onethird', 'sqrt', 'log2']) \
            .____(____, [2, 5, 10]) \
            .____()

# Create a binary classification evaluator
evaluator = ____()

# Create a cross-validator
cv = ____(____, ____, ____, ____)
कोड संपादित करें और चलाएँ