НачатьНачать бесплатно

Маскирование данных с помощью PCA

Метод псевдоанонимизации на основе PCA широко применяется в компаниях по всему миру. На платформе Kaggle можно найти множество соревнований и наборов данных, в которых данные предоставляются после PCA-преобразований.

Дифференциально приватная версия PCA также доступна в библиотеке diffprivlib — в модуле models. Она основана на классе PCA из sklearn, но принимает дополнительные аргументы: epsilon, а также минимальные и максимальные границы — точно так же, как мы видели в предыдущей главе.

В этом упражнении вы примените маскирование данных с помощью PCA к набору данных о зарплатах игроков NBA, который уже загружен под именем players.

Это упражнение является частью курса

Конфиденциальность данных и анонимизация в Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте PCA из sklearn.
  • Инициализируйте PCA(), задав количество компонент равным количеству столбцов.
  • Примените pca к players.
  • Изучите полученный набор данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import PCA from Scikit-learn
____

# Initialize PCA with number of components to be the same as the number of columns
pca = ____

# Apply PCA to the data
players_pca = ____

# Print the resulting dataset
print(pd.DataFrame(players_pca))
Редактировать и запускать код