Zacznij terazZacznij za darmo

Maskowanie danych za pomocą PCA

PCA do pseudoanonimizacji jest szeroko stosowane przez firmy. Na platformie Kaggle znajdziesz wiele zbiorów danych i wyzwań, w których dane są udostępniane po transformacji PCA.

Diferencjalnie prywatna wersja PCA jest również dostępna w bibliotece diffprivlib, w module models. Bazuje ona na klasie PCA z biblioteki sklearn, ale oferuje opcjonalne argumenty dla epsilona oraz dolnych i górnych granic – tak jak widziałeś w poprzednim rozdziale.

W tym ćwiczeniu zastosujesz maskowanie danych z użyciem PCA na zbiorze danych NBA Salaries, który jest już wczytany jako players.

To ćwiczenie jest częścią kursu

Prywatność danych i anonimizacja w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj PCA z biblioteki sklearn.
  • Zainicjalizuj PCA(), ustawiając liczbę komponentów równą liczbie kolumn.
  • Zastosuj pca do zbioru players.
  • Sprawdź wynikowy zbiór danych.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import PCA from Scikit-learn
____

# Initialize PCA with number of components to be the same as the number of columns
pca = ____

# Apply PCA to the data
players_pca = ____

# Print the resulting dataset
print(pd.DataFrame(players_pca))
Edytuj i uruchom kod