Decision trees
इस अभ्यास में आपका काम scikit-learn के DecisionTreeClassifier का उपयोग करके breast cancer डेटासेट पर एक सरल डिसीजन ट्री बनाना है, जो scikit-learn में पहले से उपलब्ध आता है.
इस डेटासेट में ब्रेस्ट बायोप्सी से लिए गए अलग-अलग ट्यूमर के विभिन्न आयामों (जैसे perimeter और texture) के संख्यात्मक माप और एक एकल आउटकम वैल्यू होती है (ट्यूमर या तो malignant होता है या benign).
हमने सैंपल्स (माप) का डेटासेट X में और प्रति ट्यूमर लक्ष्य मान y में पहले से लोड कर दिया है. अब, आपको पूरे डेटासेट को प्रशिक्षण और परीक्षण सेटों में बाँटना है, और फिर एक DecisionTreeClassifier को ट्रेन करना है. आप max_depth नाम का एक पैरामीटर निर्दिष्ट करेंगे. इस मॉडल में कई अन्य पैरामीटर भी बदले जा सकते हैं, और आप उन सभी को यहाँ देख सकते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
XGBoost के साथ Extreme Gradient Boosting
अभ्यास निर्देश
- इम्पोर्ट करें:
sklearn.model_selectionसेtrain_test_split.sklearn.treeसेDecisionTreeClassifier.
- प्रशिक्षण और टेस्ट सेट ऐसे बनाएँ कि 20% डेटा टेस्टिंग के लिए इस्तेमाल हो.
random_stateको123रखें. max_depth4के साथdt_clf_4नाम काDecisionTreeClassifierइंस्टैंशिएट करें. यह पैरामीटर बताता है कि किसी leaf node तक पहुँचने से पहले अधिकतम कितने क्रमिक split points हो सकते हैं.- क्लासिफायर को प्रशिक्षण सेट पर फिट करें और टेस्ट सेट के लेबल प्रेडिक्ट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the necessary modules
____
____
# Create the training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=____, random_state=____)
# Instantiate the classifier: dt_clf_4
dt_clf_4 = ____
# Fit the classifier to the training set
____
# Predict the labels of the test set: y_pred_4
y_pred_4 = ____
# Compute the accuracy of the predictions: accuracy
accuracy = float(np.sum(y_pred_4==y_test))/y_test.shape[0]
print("accuracy:", accuracy)