Zacznij terazZacznij za darmo

Generowanie zbiorów danych do klasteryzacji

Dane syntetyczne są w pełni legalne i spełniają wszystkie wymogi przepisów dotyczących prywatności obowiązujących na całym świecie. To wartościowa, przyjazna prywatności alternatywa dla surowych danych. Funkcja make_blobs() służy do generowania punktów danych o rozkładzie Gaussa (normalnym).

W tym ćwiczeniu wygenerujesz zbiór danych zawierający 15000 próbek.

Biblioteka numpy została już zaimportowana jako np, a niestandardowa funkcja plot_data_points() jest ponownie dostępna w tym ćwiczeniu.

To ćwiczenie jest częścią kursu

Prywatność danych i anonimizacja w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj odpowiednią funkcję z modułu datasets służącą do generowania zbiorów danych do klasteryzacji.
  • Wygeneruj zbiór danych zawierający 15000 próbek, z 2 cechami, 2 centrami i odchyleniem standardowym klastra równym 3.
  • Wyświetl kształt wygenerowanych danych.
  • Przejrzyj wygenerowane punkty danych na dwuwymiarowym wykresie rozrzutu.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____

# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____

# Print the shape of the resulting generated data
print(____)

# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)
Edytuj i uruchom kod