शुरू करेंमुफ़्त में शुरू करें

क्लस्टरिंग के लिए डेटासेट जेनरेट करना

Synthetic डेटा पूरी तरह वैध होता है और दुनिया भर के प्राइवेसी कानूनों व रेगुलेशन्स का पालन करता है. यह raw डेटा का एक सही, प्राइवेसी-फ्रेंडली विकल्प है. make_blobs() फंक्शन का उपयोग Gaussian (या normal) डिस्ट्रीब्यूशन वाले डेटा पॉइंट्स जेनरेट करने के लिए किया जा सकता है.

इस अभ्यास में, आप 15000 सैंपल्स का एक डेटासेट जेनरेट करेंगे.

numpy पहले से np के रूप में इम्पोर्ट किया गया है, और कस्टम फंक्शन plot_data_points() इस अभ्यास के लिए फिर से उपलब्ध कराया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में डेटा प्राइवेसी और अज्ञातिकरण

पाठ्यक्रम देखें

अभ्यास निर्देश

  • क्लस्टरिंग डेटासेट जेनरेट करने के लिए datasets मॉड्यूल से संबंधित फंक्शन इम्पोर्ट करें.
  • 15000 सैंपल्स, 2 फीचर्स, 2 सेंटर्स और क्लस्टर का स्टैंडर्ड डिविएशन 3 के साथ एक डेटासेट जेनरेट करें.
  • जेनरेट किए गए डेटा का shape प्रिंट करें.
  • 2-डायमेंशनल स्कैटर प्लॉट में परिणामस्वरूप डेटा पॉइंट्स को देखें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____

# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____

# Print the shape of the resulting generated data
print(____)

# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)
कोड संपादित करें और चलाएँ