शुरू करेंमुफ़्त में शुरू करें

एक जैसी प्रायिक वितरण वाले डेटासेट

Synthetic डेटा का उद्देश्य ऐसा डेटासेट बनाना है जो जितना हो सके वास्तविक लगे, और ऐसा करते हुए व्यक्तिगत जानकारी के महत्वपूर्ण हिस्सों को जोखिम में न डाले। उदाहरण के लिए, Deloitte Consulting की एक टीम ने मशीन लर्निंग मॉडल के प्रशिक्षण डेटा का 80% डेटा सिंथेसाइज़ करके तैयार किया। प्राप्त मॉडल की सटीकता वास्तविक डेटा पर प्रशिक्षित मॉडल के समान थी.

इस अभ्यास में, आप Faker का उपयोग करके बिल्कुल शुरुआत से एक synthetic डेटासेट जनरेट करेंगे, जो p के रूप में लोड की गई प्रायिक (probabilistic) वितरण का पालन करता है.

Faker जेनरेटर fake_data पहले से इनिशियलाइज़ है और numpy को np के रूप में इम्पोर्ट किया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में डेटा प्राइवेसी और अज्ञातिकरण

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)

# Generate 5 random cities 
cities = ____

# See the generated cities
print(cities)
कोड संपादित करें और चलाएँ