Förbehandling av data
Förbehandling inför klustring kan vara ett sätt att förbereda data för mer träffsäker segmentering. En typ av förbehandling är featureskalning – en teknik för att standardisera de oberoende särdragen i data så att de passar inom ett fast intervall, t.ex. 0–1 eller 0–100.
I den här övningen utför du klustring på kolumnerna parental_level_of_education och writing_score i datasetet för elevprestationer, inläst som performance. Först skapar och kör du en k-means-modell utan någon förbehandling av data. Sedan gör du samma sak men med förbehandling via featureskalning.
Den privata k-means-modellen har importerats som KMeans från diffprivlib.models. Skalaren StandardScaler och dimensionsreduktionen PCA har importerats från sklearn.
Den här övningen är en del av kursen
Dataintegritet och anonymisering i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Build the differentially private k-means model
model = KMeans(____)
# Fit the model to the data
____
# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)