НачатьНачать бесплатно

Предобработка данных

Предобработка данных перед кластеризацией помогает подготовить их к более точной сегментации. Один из видов предобработки — масштабирование признаков: метод стандартизации независимых признаков в данных, чтобы привести их к фиксированному диапазону, например 0–1 или 0–100.

В этом упражнении вы выполните кластеризацию по столбцам parental_level_of_education и writing_score из набора данных об успеваемости студентов, загруженного как performance. Сначала создайте и запустите модель k-средних без предобработки данных. Затем повторите то же самое, но с предварительным масштабированием признаков.

Приватная модель k-средних импортирована как KMeans из diffprivlib.models. Масштабировщик StandardScaler и метод снижения размерности PCA импортированы из sklearn.

Это упражнение является частью курса

Конфиденциальность данных и анонимизация в Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Build the differentially private k-means model
model = KMeans(____)

# Fit the model to the data
____

# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)
Редактировать и запускать код