Bắt đầu ngayBắt đầu miễn phí

Chuẩn bị dữ liệu nhân viên để phát hành an toàn

Khi làm việc với dữ liệu thực, bạn cần đảm bảo không có cách nào lần ra hoặc làm lộ thông tin cá nhân của khách hàng hay bất kỳ ai khác. Trong bài tập này, bạn sẽ dùng phiên bản đơn giản hóa của bộ dữ liệu IBM HR Analytics Employee để luyện tập kỹ thuật ẩn (suppression) và khái quát hóa (generalization).

Để tránh rò rỉ thông tin về bộ dữ liệu, bạn sẽ thay tên các cột bằng số.

DataFrame đã được nạp dưới tên hr, hãy dùng console để khám phá. numpy đã được import là np.

Bài tập này là một phần của khóa học

Bảo mật dữ liệu và Ẩn danh trong Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1) 

# Drop the rows with NaN values
df_cleaned = ____
Chỉnh sửa và Chạy Mã