शुरू करेंमुफ़्त में शुरू करें

एक ही probability distribution से सैंपलिंग

U.S. Census जैसी कई संस्थाएँ, निजी नागरिकों के बारे में एकत्र किए गए डेटा के सैंपल सार्वजनिक रूप से जारी करती हैं। इन डेटासेट्स को पहले अलग-अलग तकनीकों से अनॉनिमाइज़ किया जाता है, और फिर कैलकुलेशन सक्षम करने के लिए 1% से 5% के छोटे हिस्से का सैंपल जारी किया जाता है। सैंपलिंग से डेटा की सांख्यिकीय विशेषताएँ संरक्षित रहती हैं, जिससे लोग अंतर्निहित आबादी का अध्ययन और समझ कर सकते हैं.

इस अभ्यास में, आप IBM HR डेटासेट के department कॉलम को मूल डेटासेट के distributions से सैंपलिंग करके अनॉनिमाइज़ करेंगे.

डेटासेट hr के रूप में लोड किया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में डेटा प्राइवेसी और अज्ञातिकरण

पाठ्यक्रम देखें

अभ्यास निर्देश

  • department कॉलम में प्रत्येक यूनिक वैल्यू की relative frequency प्राप्त करें.
  • counts से probabilities निकालकर उन्हें distributions नाम के वैरिएबल में स्टोर करें.
  • पहले से निकाले गए probability distributions से सैंपल करें। सैंपल का size, hr डेटासेट के size के बराबर होना चाहिए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Obtain the probability distribution counts 
counts = ____

# Get the probability distribution values 
distributions = ____

# Sample from the calculated probability distributions
hr['department'] = np.random.choice(counts.index, 
                                    p=____, 
                                    size=len(____))

# See the resulting DataFrame
print(hr.head())
कोड संपादित करें और चलाएँ