डेटा को स्केल करना
डिस्टेंस-आधारित मेट्रिक्स का उपयोग करने वाले ML एल्गोरिदम के लिए, हमेशा अपने डेटा को स्केल करना बहुत ज़रूरी है, क्योंकि अलग-अलग स्केल पर मौजूद फीचर्स आपके परिणामों को बिगाड़ सकते हैं. K-means क्लस्टर सेंट्रोइड्स से दूरी मापने के लिए Euclidian distance का उपयोग करता है, इसलिए एल्गोरिदम लागू करने से पहले आपको अपने डेटा को स्केल करना होगा. पहले वही कर लेते हैं.
पिछले अभ्यास से उपलब्ध dataframe df है, जिसमें कुछ हल्की-फुल्की डेटा तैयारी हो चुकी है ताकि आप उसे sklearn के साथ उपयोग कर सकें. फ़्रॉड लेबल्स अलग से labels में स्टोर हैं, जिनसे आप बाद में परिणाम जाँच सकते हैं. numpy को np के रूप में इम्पोर्ट किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Fraud Detection
अभ्यास निर्देश
MinMaxScalerइम्पोर्ट करें.- अपने dataframe
dfको केवल उसके values लेकर numpy arrayXमें बदलें और सुनिश्चित करें कि सभी मानfloatहों. - परिभाषित स्केलर को
Xपर लागू करें ताकिX_scaledके स्केल किए हुए मान मिलें और सभी फीचर्स 0-1 स्केल पर आ जाएँ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the scaler
from sklearn.preprocessing import ____
# Take the float values of df for X
X = df.values.astype(np.____)
# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)