Sử dụng PCA
Trong bài tập này, bạn sẽ áp dụng PCA lên bộ dữ liệu wine để xem bạn có thể tăng độ chính xác của mô hình hay không.
Bài tập này là một phần của khóa học
Tiền xử lý cho Machine Learning bằng Python
Hướng dẫn bài tập
- Khởi tạo một đối tượng
PCA. - Xác định đặc trưng (
X) và nhãn (y) từwine, sử dụng nhãn trong cột"Type". - Áp dụng PCA cho
X_trainvàX_test, đảm bảo không rò rỉ dữ liệu, và lưu các giá trị đã biến đổi thànhpca_X_trainvàpca_X_test. - In thuộc tính
.explained_variance_ratio_củapcađể kiểm tra mỗi thành phần giải thích bao nhiêu phương sai.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Instantiate a PCA object
pca = ____()
# Define the features and labels from the wine dataset
X = wine.drop(____, ____)
y = wine["Type"]
X_train, X_test, y_train, y_test = train_test_split(X, y, stratify=y, random_state=42)
# Apply PCA to the wine dataset X vector
pca_X_train = ___.____(____)
pca_X_test = ___.____(____)
# Look at the percentage of variance explained by the different components
print(____)