Generowanie zbiorów danych do klasteryzacji
Dane syntetyczne są w pełni legalne i spełniają wszystkie wymogi przepisów dotyczących prywatności obowiązujących na całym świecie. To wartościowa, przyjazna prywatności alternatywa dla surowych danych. Funkcja make_blobs() służy do generowania punktów danych o rozkładzie Gaussa (normalnym).
W tym ćwiczeniu wygenerujesz zbiór danych zawierający 15000 próbek.
Biblioteka numpy została już zaimportowana jako np, a niestandardowa funkcja plot_data_points() jest ponownie dostępna w tym ćwiczeniu.
To ćwiczenie jest częścią kursu
Prywatność danych i anonimizacja w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj odpowiednią funkcję z modułu
datasetssłużącą do generowania zbiorów danych do klasteryzacji. - Wygeneruj zbiór danych zawierający
15000próbek, z2cechami,2centrami i odchyleniem standardowym klastra równym3. - Wyświetl kształt wygenerowanych danych.
- Przejrzyj wygenerowane punkty danych na dwuwymiarowym wykresie rozrzutu.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____
# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____
# Print the shape of the resulting generated data
print(____)
# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)