एक अधिक जटिल बैगिंग मॉडल
सेमी-कंडक्टर डेटा को देखने के बाद, अब इनपुट फीचर्स के आधार पर 'Pass/Fail' लेबल की भविष्यवाणी करने के लिए एक बैगिंग क्लासिफायर बनाते हैं.
प्रिप्रोसेस्ड डेटासेट आपके वर्कस्पेस में uci_secom के रूप में उपलब्ध है, और आपके लिए training और test सेट पहले से बना दिए गए हैं.
क्योंकि टार्गेट में class imbalance अधिक है, यहाँ base estimator के रूप में "balanced" लॉजिस्टिक रिग्रेशन का उपयोग करें.
हम LogisticRegression के computation समय को भी घटाएँगे, इसके लिए पैरामीटर solver='liblinear' सेट करें, जो डिफ़ॉल्ट से तेज़ optimizer है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Ensemble Methods
अभ्यास निर्देश
- निम्न पैरामीटरों के साथ base classifier के रूप में logistic regression instantiate करें:
class_weight='balanced',solver='liblinear', औरrandom_state=42. - logistic regression को base estimator बनाकर एक bagging classifier तैयार करें, जिसमें अधिकतम फीचर्स
10हों और out-of-bag score शामिल हो. - out-of-bag score प्रिंट करें ताकि उसे accuracy से तुलना कर सकें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Build a balanced logistic regression
clf_lr = ____
# Build and fit a bagging classifier
clf_bag = ____(____, ____, ____, random_state=500)
clf_bag.fit(X_train, y_train)
# Evaluate the accuracy on the test set and show the out-of-bag score
pred = clf_bag.predict(X_test)
print('Accuracy: {:.2f}'.format(accuracy_score(y_test, pred)))
print('OOB-Score: {:.2f}'.format(____))
# Print the confusion matrix
print(confusion_matrix(y_test, pred))