Začněte nyníZačněte zdarma

Generování datasetů pro shlukování

Syntetická data jsou plně legální a splňují veškeré požadavky zákonů a předpisů o ochraně soukromí po celém světě. Jsou legitimní alternativou k reálným datům s ohledem na ochranu soukromí. Funkce make_blobs() slouží ke generování datových bodů s Gaussovým (neboli normálním) rozdělením.

V tomto cvičení vygeneruješ dataset s 15000 vzorky.

numpy už je naimportován jako np a vlastní funkce plot_data_points() je pro toto cvičení opět k dispozici.

Toto cvičení je součástí kurzu

Ochrana soukromí a anonymizace dat v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Naimportuj odpovídající funkci z modulu datasets pro generování shlukovacích datasetů.
  • Vygeneruj dataset s 15000 vzorky, 2 příznaky, 2 centry a směrodatnou odchylkou shluku 3.
  • Vypiš tvar výsledných vygenerovaných dat.
  • Prohlédni si výsledné datové body ve 2D bodovém grafu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____

# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____

# Print the shape of the resulting generated data
print(____)

# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)
Upravit a spustit kód