Маскування даних за допомогою PCA
PCA для псевдоанонімізації широко використовується компаніями. На Kaggle є багато челенджів і наборів даних, де дані надаються після перетворень PCA.
Диференційно-приватна версія PCA також доступна в diffprivlib у модулі models. Вона базується на класі PCA зі sklearn, але містить додаткові необовʼязкові аргументи для епсілона та мінімальних і максимальних меж. Так само, як ми бачили в попередньому розділі.
У цій вправі ви застосуєте маскування даних за допомогою PCA до набору NBA Salaries, уже завантаженого як players.
Ця вправа є частиною курсу
Конфіденційність даних і анонімізація в Python
Інструкції до вправи
- Імпортуйте
PCAзіsklearn. - Ініціалізуйте
PCA()з кількістю компонентів, що дорівнює кількості стовпців. - Застосуйте
pcaдоplayers. - Перегляньте отриманий набір даних.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import PCA from Scikit-learn
____
# Initialize PCA with number of components to be the same as the number of columns
pca = ____
# Apply PCA to the data
players_pca = ____
# Print the resulting dataset
print(pd.DataFrame(players_pca))