Bắt đầu ngayBắt đầu miễn phí

Phân tích thành phần chính

Trong 2 chương trước, bạn đã thấy nhiều cách giảm số chiều của tập dữ liệu, bao gồm regularization và chọn đặc trưng. Khả năng giải thích các khía cạnh khác nhau của việc giảm số chiều là rất quan trọng trong một buổi phỏng vấn Machine Learning. Các tập dữ liệu lớn tốn nhiều thời gian tính toán, và nhiễu trong dữ liệu có thể làm sai lệch kết quả.

Một cách giảm số chiều là phân tích thành phần chính (PCA). Đây là phương pháp hiệu quả để thu nhỏ kích thước dữ liệu bằng cách tạo ra các đặc trưng mới, vừa giữ lại thông tin hữu ích nhất của tập dữ liệu, vừa loại bỏ đa cộng tuyến. Trong bài tập này, bạn sẽ dùng mô-đun sklearn.decomposition để thực hiện PCA trên các đặc trưng của tập dữ liệu diabetes đồng thời tách riêng biến mục tiêu progression.

Đây là vị trí hiện tại của bạn trong pipeline:

Machine learning pipeline

Bài tập này là một phần của khóa học

Luyện tập câu hỏi phỏng vấn Machine Learning bằng Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import module
from ____.____ import ____

# Feature matrix and target array
X = ____.____('____', axis=1)
y = ____['____']
Chỉnh sửa và Chạy Mã