मल्टिकॉलीनियरिटी तकनीकें - फीचर इंजीनियरिंग
मल्टिकॉलीनियरिटी एक आम समस्या है जो किसी भी मशीन लर्निंग संदर्भ में आपके प्रदर्शन को प्रभावित कर सकती है। इस छोटे से पहलू पर सही ढंग से बात करना आपके मॉडलिंग की व्याख्या को औसत से बेहतरीन बना सकता है और इंटरव्यू में आपको अलग पहचान दे सकता है।
इस अभ्यास में, आप diabetes डेटासेट पर Linear Regression का उपयोग करके एक बेसलाइन मॉडल बनाएँगे और कुछ आउटपुट मैट्रिक्स को देखेंगे। फिर आप स्वतंत्र वैरिएबल्स के बीच सहसंबंध (correlation) को विज़ुअली एक्सप्लोर करने की तकनीकों का अभ्यास करेंगे और अंत में 2 अत्यधिक सहसंबद्ध वैरिएबल्स पर फीचर इंजीनियरिंग करेंगे।
पहले दो चरणों के लिए, अपने वर्कस्पेस में इम्पोर्ट किए गए X_train, X_test, y_train, और y_test का उपयोग करें।
इसके अलावा, सभी प्रासंगिक पैकेज आपके लिए इम्पोर्ट किए जा चुके हैं:
pandas as pd, sklearn.model_selection से train_test_split, sklearn.linear_model से LinearRegression, sklearn.metrics से mean_squared_error और r2_score, matplotlib.pyplot as plt और seaborn as sns.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Machine Learning इंटरव्यू प्रश्नों का अभ्यास
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)
# Coefficient estimates
print('Coefficients: \n', lin_mod.____)
# Mean squared error
print("Mean squared error: %.2f"
% ____(____, ____))
# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))