Principal component analysis
पिछले 2 अध्यायों में, आपने अपने डेटासेट की dimensionality घटाने के कई तरीकों को देखा, जिनमें regularization और feature selection शामिल थे। मशीन लर्निंग इंटरव्यू में dimensionality घटाने के अलग-अलग पहलुओं को समझा पाना महत्वपूर्ण होता है। बड़े डेटासेट को compute करने में अधिक समय लगता है, और आपके डेटा में मौजूद noise आपके परिणामों को bias कर सकती है।
Dimensionality घटाने का एक तरीका है principal component analysis. यह डेटा का आकार घटाने का एक प्रभावी तरीका है, जिसमें नए फीचर बनाए जाते हैं जो डेटासेट की सबसे उपयोगी जानकारी को बनाए रखते हैं और साथ ही multicollinearity को हटाते हैं। इस अभ्यास में, आप sklearn.decomposition मॉड्यूल का उपयोग करके diabetes डेटासेट के फीचरों पर PCA चलाएँगे, जबकि target वैरिएबल progression को अलग रखेंगे।
पाइपलाइन में आप यहाँ पर हैं:

यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Machine Learning इंटरव्यू प्रश्नों का अभ्यास
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import module
from ____.____ import ____
# Feature matrix and target array
X = ____.____('____', axis=1)
y = ____['____']