Bắt đầu ngayBắt đầu miễn phí

Tiền xử lý dữ liệu

Tiền xử lý cho phân cụm giúp chuẩn bị dữ liệu để phân đoạn chính xác hơn. Một dạng tiền xử lý là feature scaling (chuẩn hóa thang đo đặc trưng), kỹ thuật chuẩn hóa các đặc trưng độc lập trong dữ liệu về một khoảng cố định, ví dụ 0–1 hoặc 0–100.

Trong bài tập này, bạn sẽ thực hiện phân cụm trên các cột parental_level_of_educationwriting_score trong bộ dữ liệu hiệu suất học tập đã được nạp với tên performance. Trước hết, bạn sẽ tạo và chạy mô hình k-means mà không áp dụng bất kỳ tiền xử lý nào. Sau đó, lặp lại nhưng có tiền xử lý dữ liệu bằng feature scaling.

Mô hình k-means riêng tư đã được import là KMeans từ diffprivlib.models. Bộ chuẩn hóa StandardScaler và kỹ thuật giảm chiều PCA đã được import từ sklearn.

Bài tập này là một phần của khóa học

Bảo mật dữ liệu và Ẩn danh trong Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Build the differentially private k-means model
model = KMeans(____)

# Fit the model to the data
____

# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)
Chỉnh sửa và Chạy Mã