Zacznij terazZacznij za darmo

Wstępne przetwarzanie danych

Wstępne przetwarzanie danych przed klastrowaniem to sposób na przygotowanie danych do dokładniejszej segmentacji. Jedną z technik wstępnego przetwarzania jest skalowanie cech – metoda standaryzacji niezależnych cech w zbiorze danych, tak aby mieściły się w określonym przedziale, np. 0–1 lub 0–100.

W tym ćwiczeniu wykonasz klastrowanie na kolumnach parental_level_of_education i writing_score w zbiorze danych o wynikach uczniów, wczytanym jako performance. Najpierw stworzysz i uruchomisz model k-means bez wstępnego przetwarzania danych, a następnie powtórzysz to samo, tym razem stosując skalowanie cech.

Prywatny model k-means został zaimportowany jako KMeans z diffprivlib.models. Skaler StandardScaler oraz redukcja wymiarowości PCA zostały zaimportowane z sklearn.

To ćwiczenie jest częścią kursu

Prywatność danych i anonimizacja w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Build the differentially private k-means model
model = KMeans(____)

# Fit the model to the data
____

# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)
Edytuj i uruchom kod