Предобработка данных
Предобработка данных перед кластеризацией помогает подготовить их к более точной сегментации. Один из видов предобработки — масштабирование признаков: метод стандартизации независимых признаков в данных, чтобы привести их к фиксированному диапазону, например 0–1 или 0–100.
В этом упражнении вы выполните кластеризацию по столбцам parental_level_of_education и writing_score из набора данных об успеваемости студентов, загруженного как performance. Сначала создайте и запустите модель k-средних без предобработки данных. Затем повторите то же самое, но с предварительным масштабированием признаков.
Приватная модель k-средних импортирована как KMeans из diffprivlib.models. Масштабировщик StandardScaler и метод снижения размерности PCA импортированы из sklearn.
Это упражнение является частью курса
Конфиденциальность данных и анонимизация в Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Build the differentially private k-means model
model = KMeans(____)
# Fit the model to the data
____
# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)