Generování datasetů pro shlukování
Syntetická data jsou plně legální a splňují veškeré požadavky zákonů a předpisů o ochraně soukromí po celém světě. Jsou legitimní alternativou k reálným datům s ohledem na ochranu soukromí. Funkce make_blobs() slouží ke generování datových bodů s Gaussovým (neboli normálním) rozdělením.
V tomto cvičení vygeneruješ dataset s 15000 vzorky.
numpy už je naimportován jako np a vlastní funkce plot_data_points() je pro toto cvičení opět k dispozici.
Toto cvičení je součástí kurzu
Ochrana soukromí a anonymizace dat v Pythonu
Pokyny k cvičení
- Naimportuj odpovídající funkci z modulu
datasetspro generování shlukovacích datasetů. - Vygeneruj dataset s
15000vzorky,2příznaky,2centry a směrodatnou odchylkou shluku3. - Vypiš tvar výsledných vygenerovaných dat.
- Prohlédni si výsledné datové body ve 2D bodovém grafu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____
# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____
# Print the shape of the resulting generated data
print(____)
# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)