Standardization का अभ्यास
अज्ञात distributions पर बिना सोचे-समझे KNN का उपयोग करना जोखिम भरा है. जब फीचर distributions एक जैसे scale पर नहीं होते, तो इसका प्रदर्शन काफी गिर जाता है. Unscaled फीचर्स distance कैलकुलेशन को बिगाड़ देते हैं और नतीजतन अनरीयलिस्टिक anomaly स्कोर लौटते हैं.
इसे संतुलित करने की एक आम तकनीक standardization है. इसमें किसी फीचर से mean घटाकर उसे standard deviation से भाग दिया जाता है. इससे उस फीचर का mean 0 और variance 1 हो जाता है.
females डेटासेट पर standardization का अभ्यास कीजिए. यह आपके लिए पहले से लोड किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Anomaly Detection
अभ्यास निर्देश
StandardScaler()का एक instance बनाएँ और उसेssनाम दें.- फीचर और target arrays निकालकर
Xऔरyमें रखें. targetweightkgकॉलम है. StandardScaler()को X पर fit करें और उसी समय transform भी करें.- ऊपर की प्रक्रिया दोहराएँ, लेकिन इस बार
XDataFrame के कॉलम नाम सुरक्षित रखें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
from sklearn.preprocessing import StandardScaler
# Initialize a StandardScaler
ss = ____
# Extract feature and target arrays
X = ____
y = ____
# Fit/transform X
X_transformed = ____
# Fit/transform X but preserve the column names
X.____ = ____