एक ही probability distribution से सैंपलिंग
U.S. Census जैसी कई संस्थाएँ, निजी नागरिकों के बारे में एकत्र किए गए डेटा के सैंपल सार्वजनिक रूप से जारी करती हैं। इन डेटासेट्स को पहले अलग-अलग तकनीकों से अनॉनिमाइज़ किया जाता है, और फिर कैलकुलेशन सक्षम करने के लिए 1% से 5% के छोटे हिस्से का सैंपल जारी किया जाता है। सैंपलिंग से डेटा की सांख्यिकीय विशेषताएँ संरक्षित रहती हैं, जिससे लोग अंतर्निहित आबादी का अध्ययन और समझ कर सकते हैं.
इस अभ्यास में, आप IBM HR डेटासेट के department कॉलम को मूल डेटासेट के distributions से सैंपलिंग करके अनॉनिमाइज़ करेंगे.
डेटासेट hr के रूप में लोड किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में डेटा प्राइवेसी और अज्ञातिकरण
अभ्यास निर्देश
departmentकॉलम में प्रत्येक यूनिक वैल्यू की relative frequency प्राप्त करें.countsसे probabilities निकालकर उन्हेंdistributionsनाम के वैरिएबल में स्टोर करें.- पहले से निकाले गए probability distributions से सैंपल करें। सैंपल का size,
hrडेटासेट के size के बराबर होना चाहिए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Obtain the probability distribution counts
counts = ____
# Get the probability distribution values
distributions = ____
# Sample from the calculated probability distributions
hr['department'] = np.random.choice(counts.index,
p=____,
size=len(____))
# See the resulting DataFrame
print(hr.head())