शुरू करेंमुफ़्त में शुरू करें

फ़िल्टर और रैपर मेथड्स

किसी डेटासेट की डाइमेंशनलिटी घटाने से जुड़े प्रश्न मशीन लर्निंग इंटरव्यू में बहुत सामान्य होते हैं। डाइमेंशनलिटी घटाने का एक तरीका यह है कि आप अपने डेटासेट में केवल प्रासंगिक फीचर्स ही चुनें.

यहाँ आप diabetes DataFrame पर एक फ़िल्टर मेथड का अभ्यास करेंगे, उसके बाद क्रॉस-वैलिडेशन सहित 2 अलग-अलग तरह के रैपर मेथड्स लागू करेंगे। आप सह-संबंधों को विज़ुअलाइज़ करने, अपने डेटा को प्रोसेस करने और अपने डेटासेट पर फीचर सेलेक्शन तकनीकें लागू करने के लिए pandas, matplotlib.pyplot और seaborn का उपयोग करेंगे.

ड्रॉप किए गए टार्गेट वैरिएबल कॉलम (progression) के साथ फीचर मैट्रिक्स X के रूप में लोड है, जबकि टार्गेट वैरिएबल y के रूप में लोड है.

ध्यान दें कि pandas, matplotlib.pyplot, और seaborn पहले से आपके वर्कस्पेस में इम्पोर्ट हैं और क्रमशः pd, plt, और sns के रूप में एलियस किए गए हैं.

ध्यान दें कि आपने अपनी पाइपलाइन में एक Cross-validate स्टेप जोड़ा है (जो अंतिम 3 स्टेप्स पर लागू होता है):

Machine learning pipeline

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Machine Learning इंटरव्यू प्रश्नों का अभ्यास

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create correlation matrix and print it
cor = ____.____()
print(____)

# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()

# Correlation with output variable
cor_target = abs(cor["progression"])

# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)
कोड संपादित करें और चलाएँ