ПочатиПочніть безкоштовно

Попередня обробка даних

Попередня обробка для кластеризації допомагає підготувати дані для точнішої сегментації. Один із видів попередньої обробки — масштабування ознак, тобто стандартизація незалежних ознак у даних до фіксованого діапазону, наприклад 0–1 або 0–100.

У цій вправі ви виконуватимете кластеризацію за стовпцями parental_level_of_education та writing_score у наборі даних про успішність студентів, завантаженому як performance. Спочатку ви створите й запустите модель k-means без жодної попередньої обробки даних. Потім виконаєте те саме, але з попередньою обробкою за допомогою масштабування ознак.

Приватну модель k-means імпортовано як KMeans з diffprivlib.models. Масштабувальник StandardScaler і метод зменшення розмірності PCA імпортовано зі sklearn.

Ця вправа є частиною курсу

Конфіденційність даних і анонімізація в Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Build the differentially private k-means model
model = KMeans(____)

# Fit the model to the data
____

# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)
Редагувати та запускати код