शुरू करेंमुफ़्त में शुरू करें

सबसे उपयुक्त सतत डिस्ट्रीब्यूशन से सैंपलिंग

किसी अच्छी तरह फ़िट होने वाले probability distribution से रैंडम सैंपलिंग करने से प्राइवेसी बनी रहती है. साथ ही, यह अधिकृत टीमों को डेटा का सटीक सांख्यिकीय विश्लेषण करने देता है.

इस अभ्यास में, आप IBM डेटासेट के monthly_income कॉलम को अनॉनिमाइज़ करेंगे. पिछले लेसन में, आपने तय किया था कि exponnorm सतत डिस्ट्रीब्यूशन सबसे अच्छा फ़िट है. इनकम को मॉडल करने के लिए इसी का उपयोग करें.

डेटासेट hr के रूप में उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में डेटा प्राइवेसी और अज्ञातिकरण

पाठ्यक्रम देखें

अभ्यास निर्देश

  • scipy पैकेज से stats मॉड्यूल इम्पोर्ट करें.
  • सतत वैरिएबल monthly_income पर exponnorm डिस्ट्रीब्यूशन फिट करें ताकि डिस्ट्रीब्यूशन के पैरामीटर मिलें और बाद में सैंपल जनरेट किए जा सकें.
  • exponnorm डिस्ट्रीब्यूशन से सैंपल लें और .rvs() मेथड का उपयोग करके monthly_income को रिप्लेस करें. size को कॉलम की लंबाई के बराबर स्पेसिफ़ाइ करें.
  • सैलरी को निकटतम पूर्णांक तक राउंड करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import stats from scipy
____

# Fit the exponnorm distribution to the continuous variable monthly income
params = ____

# Sample from the exponnorm distribution and replace monthly income
hr['monthly_income'] = ____

# Round the salaries to their closest integer
hr['monthly_income'] = ____

# See the resulting dataset
print(hr.head())
कोड संपादित करें और चलाएँ