CommencezCommencez gratuitement

Prétraitement des données

Le prétraitement pour le regroupement (clustering) permet de préparer les données afin d'obtenir une segmentation plus précise. Un type de prétraitement est la mise à l'échelle des caractéristiques (feature scaling), une technique qui standardise les variables indépendantes présentes dans les données pour les faire entrer dans une plage fixe, p. ex. 0-1 ou 0-100.

Dans cet exercice, vous effectuerez un regroupement sur les colonnes parental_level_of_education et writing_score dans l'ensemble de données sur le rendement des élèves chargé sous le nom performance. Vous allez d'abord créer et exécuter un modèle k-means sans aucun prétraitement des données. Ensuite, vous referez la même chose, mais en prétraitant les données avec une mise à l'échelle des caractéristiques.

Le modèle k-means privé a été importé sous le nom KMeans depuis diffprivlib.models. Le normaliseur StandardScaler et la réduction de dimension PCA ont été importés depuis sklearn.

Cette activité fait partie du cours

Confidentialité des données et anonymisation en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Build the differentially private k-means model
model = KMeans(____)

# Fit the model to the data
____

# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)
Modifier et exécuter le code