Kom igångKom igång gratis

Förbehandling av data

Förbehandling inför klustring kan vara ett sätt att förbereda data för mer träffsäker segmentering. En typ av förbehandling är featureskalning – en teknik för att standardisera de oberoende särdragen i data så att de passar inom ett fast intervall, t.ex. 0–1 eller 0–100.

I den här övningen utför du klustring på kolumnerna parental_level_of_education och writing_score i datasetet för elevprestationer, inläst som performance. Först skapar och kör du en k-means-modell utan någon förbehandling av data. Sedan gör du samma sak men med förbehandling via featureskalning.

Den privata k-means-modellen har importerats som KMeans från diffprivlib.models. Skalaren StandardScaler och dimensionsreduktionen PCA har importerats från sklearn.

Den här övningen är en del av kursen

Dataintegritet och anonymisering i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Build the differentially private k-means model
model = KMeans(____)

# Fit the model to the data
____

# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)
Redigera och kör kod