शुरू करेंमुफ़्त में शुरू करें

सब कुछ एक साथ लाना

आप अभी-अभी एक एरिदमिया डिटेक्शन स्टार्टअप से जुड़े हैं और arrh एरिदमिया डेटासेट पर एक मॉडल ट्रेन करना चाहते हैं। आपने देखा है कि रैंडम फॉरेस्ट्स कई Kaggle प्रतियोगिताओं में जीतते हैं, इसलिए आप ग्रिड सर्च का उपयोग करते हुए अधिकतम गहराई 2, 5, या 10 पर इसे आज़माना चाहते हैं। आप यह भी देखते हैं कि डेटासेट का डायमेंशन काफ़ी बड़ा है, इसलिए आप एक फीचर सेलेक्शन मेथड के प्रभाव पर विचार करना चाहते हैं.

यह सुनिश्चित करने के लिए कि आप गलती से ओवरफिट न करें, आपने पहले ही अपना डेटा स्प्लिट कर लिया है। आप ग्रिड सर्च के लिए X_train और y_train का उपयोग करेंगे, और यह तय करने के लिए कि फीचर सेलेक्शन मदद करता है या नहीं, X_test और y_test का उपयोग करेंगे। सभी चार डेटासेट फोल्ड आपके एनवायरनमेंट में पहले से लोड हैं। आपके पास GridSearchCV(), train_test_split(), SelectKBest(), chi2() और RandomForestClassifier (उपनाम rfc) तक पहुँच भी है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में मशीन लर्निंग वर्कफ़्लो डिज़ाइन करना

पाठ्यक्रम देखें

अभ्यास निर्देश

  • RandomForestClassifier के लिए अधिकतम गहराई 2, 5, और 10 पर ग्रिड सर्च चलाएँ और सर्वश्रेष्ठ परफॉर्मिंग पैरामीटर सेटिंग सहेजें.
  • अब ऊपर निकाले गए सर्वश्रेष्ठ-परफॉर्मिंग संख्या के एस्टिमेटर्स के साथ एस्टीमेटर को पुनः फिट करें.
  • chi2 स्कोरिंग फंक्शन के साथ SelectKBest फीचर सेलेक्टर लागू करें और क्लासिफायर को फिर से फिट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Find the best value for max_depth among values 2, 5 and 10
grid_search = GridSearchCV(
  ____(random_state=1), param_grid=____)
best_value = grid_search.____(
  ____, ____).best_params_['max_depth']

# Using the best value from above, fit a random forest
clf = rfc(
  random_state=1, ____=best_value).____(X_train, y_train)

# Apply SelectKBest with chi2 and pick top 100 features
vt = SelectKBest(____, k=____).____(X_train, y_train)

# Create a new dataset only containing the selected features
X_train_reduced = ____.transform(____)
कोड संपादित करें और चलाएँ