शुरू करेंमुफ़्त में शुरू करें

सुसंगत सिंथेटिक डेटासेट

एक आम परिदृश्य जिसमें कंपनियाँ सिंथेटिक डेटा का उपयोग करती हैं, वह है आर्टिफिशियल इंटेलिजेंस और मशीन लर्निंग मॉडलों का प्रशिक्षण। वास्तविक दुनिया का डेटा कभी-कभी जुटाने में महँगा होता है, या आसानी से मिल ही नहीं पाता। जब प्रशिक्षण डेटा बहुत असंतुलित हो (जैसे, 90% से अधिक इंस्टैंसेज़ एक ही क्लास में हों), तो सिंथेटिक डेटा जेनरेशन सटीक मशीन लर्निंग मॉडल बनाने में मदद कर सकती है.

इस अभ्यास में, आप Faker का उपयोग करके एक मोबाइल ऐप रेटिंग डेटासेट जनरेट करेंगे.

प्रारंभिक DataFrame ratings के रूप में लोड है, जिसमें दो कॉलम हैं: rating और gender। आपके लिए एक Faker() जेनरेटर पहले से fake_data नाम से इनिशियलाइज़ किया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में डेटा प्राइवेसी और अज्ञातिकरण

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female" 
                   else ____
                   for x in ratings['gender']] 
कोड संपादित करें और चलाएँ