Générer des jeux de données pour le regroupement
Les données synthétiques sont entièrement conformes et respectent toutes les exigences des lois et des règlements sur la protection des renseignements personnels partout dans le monde. Elles constituent une solution valable et respectueuse de la vie privée aux données brutes. La fonction make_blobs() permet de générer des points de données selon une distribution gaussienne (ou normale).
Dans cet exercice, vous allez générer un jeu de données de 15000 observations.
numpy a déjà été importé sous le nom np, et la fonction personnalisée plot_data_points() est fournie de nouveau pour cet exercice.
Cette activité fait partie du cours
Confidentialité des données et anonymisation en Python
Instructions de l’exercice
- Importez la fonction correspondante du module
datasetspour générer des jeux de données de regroupement. - Générez un jeu de données de
15000observations avec2caractéristiques,2centres et un écart-type de regroupement de3. - Affichez la forme (shape) des données générées.
- Inspectez les points de données résultants dans un nuage de points en deux dimensions.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____
# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____
# Print the shape of the resulting generated data
print(____)
# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)