Kom igångKom igång gratis

Generera datamängder för klustring

Syntetisk data är fullt laglig och uppfyller alla krav i sekretesslagar och -regler världen över. Det är ett giltigt, integritetsvänligt alternativ till rådata. Funktionen make_blobs() kan användas för att generera datapunkter med en gaussisk (eller normal) fördelning.

I den här övningen genererar du en datamängd med 15000 sampel.

numpy har redan importerats som np, och den anpassade funktionen plot_data_points() finns tillgänglig även i den här övningen.

Den här övningen är en del av kursen

Dataintegritet och anonymisering i Python

Visa kurs

Övningsinstruktioner

  • Importera motsvarande funktion från modulen datasets för att generera klustringsdatamängder.
  • Generera en datamängd med 15000 sampel, 2 särdrag, 2 centra och en klusterstandardavvikelse på 3.
  • Skriv ut formen på den genererade datan.
  • Undersök de resulterande datapunkterna i ett tvådimensionellt spridningsdiagram.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____

# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____

# Print the shape of the resulting generated data
print(____)

# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)
Redigera och kör kod