Maskowanie danych za pomocą PCA
PCA do pseudoanonimizacji jest szeroko stosowane przez firmy. Na platformie Kaggle znajdziesz wiele zbiorów danych i wyzwań, w których dane są udostępniane po transformacji PCA.
Diferencjalnie prywatna wersja PCA jest również dostępna w bibliotece diffprivlib, w module models. Bazuje ona na klasie PCA z biblioteki sklearn, ale oferuje opcjonalne argumenty dla epsilona oraz dolnych i górnych granic – tak jak widziałeś w poprzednim rozdziale.
W tym ćwiczeniu zastosujesz maskowanie danych z użyciem PCA na zbiorze danych NBA Salaries, który jest już wczytany jako players.
To ćwiczenie jest częścią kursu
Prywatność danych i anonimizacja w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj
PCAz bibliotekisklearn. - Zainicjalizuj
PCA(), ustawiając liczbę komponentów równą liczbie kolumn. - Zastosuj
pcado zbioruplayers. - Sprawdź wynikowy zbiór danych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import PCA from Scikit-learn
____
# Initialize PCA with number of components to be the same as the number of columns
pca = ____
# Apply PCA to the data
players_pca = ____
# Print the resulting dataset
print(pd.DataFrame(players_pca))