शुरू करेंमुफ़्त में शुरू करें

PCA के साथ डेटा मास्किंग

कई कंपनियाँ pseudo-anonymization के लिए PCA का व्यापक रूप से उपयोग करती हैं. Kaggle पर आपको कई चुनौतियाँ और डेटासेट मिलेंगे जहाँ डेटा PCA transformations के बाद उपलब्ध कराया गया है.

PCA का एक differentially private संस्करण diffprivlib की models मॉड्यूल में भी शामिल है. यह sklearn की PCA क्लास पर आधारित है, लेकिन इसमें epsilon और min व max bounds के लिए वैकल्पिक आर्गुमेंट्स दिए जा सकते हैं. ठीक वैसे ही जैसे हमने पिछले अध्याय में देखा था.

इस अभ्यास में, आप NBA Salaries डेटासेट पर PCA से डेटा मास्किंग लागू करेंगे, जो पहले से players के रूप में लोड है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में डेटा प्राइवेसी और अज्ञातिकरण

पाठ्यक्रम देखें

अभ्यास निर्देश

  • sklearn से PCA इम्पोर्ट करें.
  • PCA() को initialize करें ताकि components की संख्या कॉलमों की संख्या के बराबर हो.
  • pca को players पर लागू करें.
  • प्राप्त हुए डेटासेट को देखें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import PCA from Scikit-learn
____

# Initialize PCA with number of components to be the same as the number of columns
pca = ____

# Apply PCA to the data
players_pca = ____

# Print the resulting dataset
print(pd.DataFrame(players_pca))
कोड संपादित करें और चलाएँ