डेटा का प्री-प्रोसेसिंग
क्लस्टरिंग से पहले प्री-प्रोसेसिंग करने से अधिक सटीक सेगमेंटेशन के लिए डेटा तैयार किया जा सकता है। प्री-प्रोसेसिंग का एक तरीका है फीचर स्केलिंग, जिसमें डेटा के स्वतंत्र फीचर्स को एक निश्चित रेंज में मानकीकृत किया जाता है, जैसे 0-1 या 0-100.
इस अभ्यास में, आप छात्र प्रदर्शन डेटासेट performance की parental_level_of_education और writing_score कॉलम्स पर क्लस्टरिंग करेंगे। पहले, आप बिना किसी प्री-प्रोसेसिंग के k-means मॉडल बनाएँगे और चलाएँगे। फिर, फीचर स्केलिंग के साथ प्री-प्रोसेसिंग करके वही प्रक्रिया दोहराएँगे।
प्राइवेट k-means मॉडल को diffprivlib.models से KMeans के रूप में इंपोर्ट किया गया है। StandardScaler स्केलर और डायमेंशनलिटी रिडक्शन PCA को sklearn से इंपोर्ट किया गया है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में डेटा प्राइवेसी और अज्ञातिकरण
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Build the differentially private k-means model
model = KMeans(____)
# Fit the model to the data
____
# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)