ÎncepețiÎncepe gratuit

Generarea seturilor de date pentru clustering

Datele sintetice sunt complet legale și îndeplinesc toate cerințele legilor și reglementărilor privind confidențialitatea din întreaga lume. Reprezintă o alternativă validă și responsabilă față de datele brute, din perspectiva protecției vieții private. Funcția make_blobs() poate fi folosită pentru a genera puncte de date cu o distribuție gaussiană (sau normală).

În acest exercițiu, vei genera un set de date cu 15000 de eșantioane.

numpy a fost deja importat ca np, iar funcția personalizată plot_data_points() a fost pusă din nou la dispoziție pentru acest exercițiu.

Acest exercițiu face parte din cursul

Confidențialitatea datelor și anonimizarea în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă funcția corespunzătoare din modulul datasets pentru generarea seturilor de date de tip clustering.
  • Generează un set de date cu 15000 de eșantioane, 2 caracteristici, 2 centre și o deviație standard a clusterului de 3.
  • Afișează forma datelor generate.
  • Inspectează punctele de date rezultate într-un grafic scatter bidimensional.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____

# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____

# Print the shape of the resulting generated data
print(____)

# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)
Editează și rulează codul