CommencezCommencez gratuitement

Générer des jeux de données pour le regroupement

Les données synthétiques sont entièrement conformes et respectent toutes les exigences des lois et des règlements sur la protection des renseignements personnels partout dans le monde. Elles constituent une solution valable et respectueuse de la vie privée aux données brutes. La fonction make_blobs() permet de générer des points de données selon une distribution gaussienne (ou normale).

Dans cet exercice, vous allez générer un jeu de données de 15000 observations.

numpy a déjà été importé sous le nom np, et la fonction personnalisée plot_data_points() est fournie de nouveau pour cet exercice.

Cette activité fait partie du cours

Confidentialité des données et anonymisation en Python

Voir le cours

Instructions de l’exercice

  • Importez la fonction correspondante du module datasets pour générer des jeux de données de regroupement.
  • Générez un jeu de données de 15000 observations avec 2 caractéristiques, 2 centres et un écart-type de regroupement de 3.
  • Affichez la forme (shape) des données générées.
  • Inspectez les points de données résultants dans un nuage de points en deux dimensions.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____

# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____

# Print the shape of the resulting generated data
print(____)

# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)
Modifier et exécuter le code