Chuẩn bị dữ liệu nhân viên để phát hành an toàn
Khi làm việc với dữ liệu thực, bạn cần đảm bảo không có cách nào lần ra hoặc làm lộ thông tin cá nhân của khách hàng hay bất kỳ ai khác. Trong bài tập này, bạn sẽ dùng phiên bản đơn giản hóa của bộ dữ liệu IBM HR Analytics Employee để luyện tập kỹ thuật ẩn (suppression) và khái quát hóa (generalization).
Để tránh rò rỉ thông tin về bộ dữ liệu, bạn sẽ thay tên các cột bằng số.
DataFrame đã được nạp dưới tên hr, hãy dùng console để khám phá. numpy đã được import là np.
Bài tập này là một phần của khóa học
Bảo mật dữ liệu và Ẩn danh trong Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1)
# Drop the rows with NaN values
df_cleaned = ____