Generarea seturilor de date pentru clustering
Datele sintetice sunt complet legale și îndeplinesc toate cerințele legilor și reglementărilor privind confidențialitatea din întreaga lume. Reprezintă o alternativă validă și responsabilă față de datele brute, din perspectiva protecției vieții private. Funcția make_blobs() poate fi folosită pentru a genera puncte de date cu o distribuție gaussiană (sau normală).
În acest exercițiu, vei genera un set de date cu 15000 de eșantioane.
numpy a fost deja importat ca np, iar funcția personalizată plot_data_points() a fost pusă din nou la dispoziție pentru acest exercițiu.
Acest exercițiu face parte din cursul
Confidențialitatea datelor și anonimizarea în Python
Instrucțiuni pentru exercițiu
- Importă funcția corespunzătoare din modulul
datasetspentru generarea seturilor de date de tip clustering. - Generează un set de date cu
15000de eșantioane,2caracteristici,2centre și o deviație standard a clusterului de3. - Afișează forma datelor generate.
- Inspectează punctele de date rezultate într-un grafic scatter bidimensional.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____
# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____
# Print the shape of the resulting generated data
print(____)
# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)