Feature selection
मॉडलिंग के लिए डेटा तैयार करते समय यह ज़रूरी है कि आपके पास ऐसे उपयोगी फीचर हों जिनके आधार पर मॉडल अपनी भविष्यवाणी (या निदान) करे। उपयोगी होने के लिए, फीचर को हृदय रोग डेटासेट की आवश्यक विशेषताओं को परस्पर स्वतंत्र (orthogonal) तरीके से कैप्चर करना चाहिए; अधिक डेटा हमेशा बेहतर नहीं होता!
आप उपयोगी फीचर चुनने के लिए sklearn.feature_selection.SelectFromModel मॉड्यूल का इस्तेमाल कर सकते हैं। SelectFromModel एक brute-force तरीका लागू करता है जो RandomForestClassifier मॉडल का उपयोग करके हृदय रोग निदान वाले कार्य के लिए सबसे महत्वपूर्ण फीचर ढूँढता है।
RandomForestClassifier इम्पोर्ट किया जा चुका है और हृदय रोग डेटा के फीचर और टारगेट क्रमशः X_train और y_train के रूप में इम्पोर्ट किए जा चुके हैं।
यह अभ्यास पाठ्यक्रम का हिस्सा है
एंड-टू-एंड मशीन लर्निंग
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
from sklearn.feature_selection import SelectFromModel
# Define the random forest model and fit to the training data
rf = ____(____=____, ____=____, ____=____)
rf.____(____, ____)