ПочатиПочніть безкоштовно

Маскування даних за допомогою PCA

PCA для псевдоанонімізації широко використовується компаніями. На Kaggle є багато челенджів і наборів даних, де дані надаються після перетворень PCA.

Диференційно-приватна версія PCA також доступна в diffprivlib у модулі models. Вона базується на класі PCA зі sklearn, але містить додаткові необовʼязкові аргументи для епсілона та мінімальних і максимальних меж. Так само, як ми бачили в попередньому розділі.

У цій вправі ви застосуєте маскування даних за допомогою PCA до набору NBA Salaries, уже завантаженого як players.

Ця вправа є частиною курсу

Конфіденційність даних і анонімізація в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте PCA зі sklearn.
  • Ініціалізуйте PCA() з кількістю компонентів, що дорівнює кількості стовпців.
  • Застосуйте pca до players.
  • Перегляньте отриманий набір даних.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import PCA from Scikit-learn
____

# Initialize PCA with number of components to be the same as the number of columns
pca = ____

# Apply PCA to the data
players_pca = ____

# Print the resulting dataset
print(pd.DataFrame(players_pca))
Редагувати та запускати код