Začněte nyníZačněte zdarma

Maskování dat pomocí PCA

PCA pro pseudoanonymizaci je ve firmách hojně využívaná metoda. Na Kaggle najdeš celou řadu výzev a datových sad, kde jsou data poskytnutá po PCA transformaci.

Diferenciálně soukromá verze PCA je také součástí knihovny diffprivlib v modulu models. Vychází z třídy PCA ze sklearn, ale navíc podporuje volitelné argumenty pro epsilon a minimální a maximální hranice – stejně jako jsme viděli v předchozí kapitole.

V tomto cvičení použiješ maskování dat pomocí PCA na datové sadě NBA Salaries, která je už načtena jako players.

Toto cvičení je součástí kurzu

Ochrana soukromí a anonymizace dat v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj PCA z knihovny sklearn.
  • Inicializuj PCA() tak, aby počet komponent odpovídal počtu sloupců.
  • Aplikuj pca na players.
  • Prohlédni si výslednou datovou sadu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import PCA from Scikit-learn
____

# Initialize PCA with number of components to be the same as the number of columns
pca = ____

# Apply PCA to the data
players_pca = ____

# Print the resulting dataset
print(pd.DataFrame(players_pca))
Upravit a spustit kód