Generera datamängder för klustring
Syntetisk data är fullt laglig och uppfyller alla krav i sekretesslagar och -regler världen över. Det är ett giltigt, integritetsvänligt alternativ till rådata. Funktionen make_blobs() kan användas för att generera datapunkter med en gaussisk (eller normal) fördelning.
I den här övningen genererar du en datamängd med 15000 sampel.
numpy har redan importerats som np, och den anpassade funktionen plot_data_points() finns tillgänglig även i den här övningen.
Den här övningen är en del av kursen
Dataintegritet och anonymisering i Python
Övningsinstruktioner
- Importera motsvarande funktion från modulen
datasetsför att generera klustringsdatamängder. - Generera en datamängd med
15000sampel,2särdrag,2centra och en klusterstandardavvikelse på3. - Skriv ut formen på den genererade datan.
- Undersök de resulterande datapunkterna i ett tvådimensionellt spridningsdiagram.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____
# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____
# Print the shape of the resulting generated data
print(____)
# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)