Маскирование данных с помощью PCA
Метод псевдоанонимизации на основе PCA широко применяется в компаниях по всему миру. На платформе Kaggle можно найти множество соревнований и наборов данных, в которых данные предоставляются после PCA-преобразований.
Дифференциально приватная версия PCA также доступна в библиотеке diffprivlib — в модуле models. Она основана на классе PCA из sklearn, но принимает дополнительные аргументы: epsilon, а также минимальные и максимальные границы — точно так же, как мы видели в предыдущей главе.
В этом упражнении вы примените маскирование данных с помощью PCA к набору данных о зарплатах игроков NBA, который уже загружен под именем players.
Это упражнение является частью курса
Конфиденциальность данных и анонимизация в Python
Инструкции к упражнению
- Импортируйте
PCAизsklearn. - Инициализируйте
PCA(), задав количество компонент равным количеству столбцов. - Примените
pcaкplayers. - Изучите полученный набор данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import PCA from Scikit-learn
____
# Initialize PCA with number of components to be the same as the number of columns
pca = ____
# Apply PCA to the data
players_pca = ____
# Print the resulting dataset
print(pd.DataFrame(players_pca))