Wstępne przetwarzanie danych
Wstępne przetwarzanie danych przed klastrowaniem to sposób na przygotowanie danych do dokładniejszej segmentacji. Jedną z technik wstępnego przetwarzania jest skalowanie cech – metoda standaryzacji niezależnych cech w zbiorze danych, tak aby mieściły się w określonym przedziale, np. 0–1 lub 0–100.
W tym ćwiczeniu wykonasz klastrowanie na kolumnach parental_level_of_education i writing_score w zbiorze danych o wynikach uczniów, wczytanym jako performance. Najpierw stworzysz i uruchomisz model k-means bez wstępnego przetwarzania danych, a następnie powtórzysz to samo, tym razem stosując skalowanie cech.
Prywatny model k-means został zaimportowany jako KMeans z diffprivlib.models. Skaler StandardScaler oraz redukcja wymiarowości PCA zostały zaimportowane z sklearn.
To ćwiczenie jest częścią kursu
Prywatność danych i anonimizacja w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Build the differentially private k-means model
model = KMeans(____)
# Fit the model to the data
____
# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)