Попередня обробка даних
Попередня обробка для кластеризації допомагає підготувати дані для точнішої сегментації. Один із видів попередньої обробки — масштабування ознак, тобто стандартизація незалежних ознак у даних до фіксованого діапазону, наприклад 0–1 або 0–100.
У цій вправі ви виконуватимете кластеризацію за стовпцями parental_level_of_education та writing_score у наборі даних про успішність студентів, завантаженому як performance. Спочатку ви створите й запустите модель k-means без жодної попередньої обробки даних. Потім виконаєте те саме, але з попередньою обробкою за допомогою масштабування ознак.
Приватну модель k-means імпортовано як KMeans з diffprivlib.models. Масштабувальник StandardScaler і метод зменшення розмірності PCA імпортовано зі sklearn.
Ця вправа є частиною курсу
Конфіденційність даних і анонімізація в Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Build the differentially private k-means model
model = KMeans(____)
# Fit the model to the data
____
# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)