Differentially Private classifier बनाएँ
इस अभ्यास में, आप Penguin डेटासेट पर एक private Gaussian Naive Bayes मॉडल बनाएँगे और ट्रेन करेंगे ताकि यह क्लासीफ़ाई कर सके कि कोई पेंगुइन नर है या मादा.
K-anonymity उच्च-आयामी या विविध डेटासेट पर अच्छी तरह काम नहीं करता, क्योंकि इसके महत्वपूर्ण सैद्धांतिक और अनुभवजन्य सीमाएँ हैं — जिसे "curse of dimensionality" कहा जाता है. जैसे-जैसे फीचर्स या dimensions की संख्या बढ़ती है, सही तरह से generalize करने के लिए आवश्यक डेटा की मात्रा घातीय रूप से बढ़ती है. यही कारणों में से एक है कि differential privacy वर्तमान में पसंदीदा privacy मॉडल है. Epsilon किसी भी background knowledge से स्वतंत्र होता है और संवेदनशील जानकारी को "bound" करता है.
DataFrame penguin_df के रूप में लोड है और X_train, y_train, X_test और y_test में विभाजित है. Private मॉडल क्लास dp_GaussianNB के रूप में इम्पोर्ट किया जा चुका है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में डेटा प्राइवेसी और अज्ञातिकरण
अभ्यास निर्देश
- बिना पैरामीटर के एक
dp_GaussianNBclassifier बनाएँ. - पहले बनाए गए मॉडल को बिना किसी पैरामीटर के डेटा पर fit करें.
- टेस्ट डेटा के आधार पर private मॉडल का score निकालें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Built the private classifier without parameters
dp_clf = ____
# Fit the model to the data
____(X_train, y_train)
# Print the accuracy score
print("The accuracy with default settings is ", ____(X_test, y_test))