Preprocesarea datelor
Preprocesarea pentru clustering poate fi o modalitate de a pregăti datele pentru o segmentare mai precisă. Un tip de preprocesare este scalarea caracteristicilor – o tehnică de standardizare a caracteristicilor independente din date, astfel încât să se încadreze într-un interval fix, de exemplu 0-1 sau 0-100.
În acest exercițiu, vei aplica clustering pe coloanele parental_level_of_education și writing_score din setul de date privind performanța elevilor, încărcat ca performance. Mai întâi, vei crea și rula un model k-means fără nicio preprocesare. Apoi, vei face același lucru, dar cu preprocesarea datelor prin scalarea caracteristicilor.
Modelul privat k-means a fost importat ca KMeans din diffprivlib.models. Scalerul StandardScaler și reducerea dimensionalității PCA au fost importate din sklearn.
Acest exercițiu face parte din cursul
Confidențialitatea datelor și anonimizarea în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Build the differentially private k-means model
model = KMeans(____)
# Fit the model to the data
____
# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)