Che giấu dữ liệu với PCA
PCA để giả ẩn danh (pseudo-anonymization) được rất nhiều công ty sử dụng. Bạn có thể tìm thấy nhiều thử thách và bộ dữ liệu trên Kaggle trong đó dữ liệu được cung cấp sau khi đã biến đổi bằng PCA.
Một phiên bản PCA có tính riêng tư vi phân cũng có trong diffprivlib ở mô-đun models. Nó dựa trên lớp PCA từ sklearn nhưng bổ sung các tham số tùy chọn cho epsilon và giới hạn min/max, giống như bạn đã thấy ở chương trước.
Trong bài tập này, bạn sẽ áp dụng che giấu dữ liệu bằng PCA trên bộ dữ liệu Lương NBA, đã được nạp sẵn dưới tên players.
Bài tập này là một phần của khóa học
Bảo mật dữ liệu và Ẩn danh trong Python
Hướng dẫn bài tập
- Import
PCAtừsklearn. - Khởi tạo
PCA()với số thành phần bằng đúng số cột. - Áp dụng
pcalênplayers. - Xem bộ dữ liệu thu được.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import PCA from Scikit-learn
____
# Initialize PCA with number of components to be the same as the number of columns
pca = ____
# Apply PCA to the data
players_pca = ____
# Print the resulting dataset
print(pd.DataFrame(players_pca))