Maskování dat pomocí PCA
PCA pro pseudoanonymizaci je ve firmách hojně využívaná metoda. Na Kaggle najdeš celou řadu výzev a datových sad, kde jsou data poskytnutá po PCA transformaci.
Diferenciálně soukromá verze PCA je také součástí knihovny diffprivlib v modulu models. Vychází z třídy PCA ze sklearn, ale navíc podporuje volitelné argumenty pro epsilon a minimální a maximální hranice – stejně jako jsme viděli v předchozí kapitole.
V tomto cvičení použiješ maskování dat pomocí PCA na datové sadě NBA Salaries, která je už načtena jako players.
Toto cvičení je součástí kurzu
Ochrana soukromí a anonymizace dat v Pythonu
Pokyny k cvičení
- Importuj
PCAz knihovnysklearn. - Inicializuj
PCA()tak, aby počet komponent odpovídal počtu sloupců. - Aplikuj
pcanaplayers. - Prohlédni si výslednou datovou sadu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import PCA from Scikit-learn
____
# Initialize PCA with number of components to be the same as the number of columns
pca = ____
# Apply PCA to the data
players_pca = ____
# Print the resulting dataset
print(pd.DataFrame(players_pca))