Bắt đầu ngayBắt đầu miễn phí

Phương pháp filter và wrapper

Các câu hỏi về giảm số chiều của tập dữ liệu xuất hiện rất thường xuyên trong phỏng vấn Machine Learning. Một cách để giảm số chiều là chỉ chọn những đặc trưng (feature) phù hợp trong tập dữ liệu của bạn.

Tại đây, bạn sẽ thực hành một phương pháp filter trên DataFrame diabetes, sau đó là 2 kiểu phương pháp wrapper khác nhau có kèm cross-validation. Bạn sẽ dùng pandas, matplotlib.pyplotseaborn để trực quan hóa tương quan, xử lý dữ liệu và áp dụng các kỹ thuật chọn đặc trưng cho tập dữ liệu.

Ma trận đặc trưng sau khi đã loại bỏ cột biến mục tiêu (progression) được nạp là X, còn biến mục tiêu được nạp là y.

Lưu ý pandas, matplotlib.pyplotseaborn đã được import sẵn vào không gian làm việc của bạn và đặt bí danh lần lượt là pd, pltsns.

Hãy chú ý bạn đã thêm bước Cross-validate vào pipeline (áp dụng cho 3 bước cuối):

Machine learning pipeline

Bài tập này là một phần của khóa học

Luyện tập câu hỏi phỏng vấn Machine Learning bằng Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create correlation matrix and print it
cor = ____.____()
print(____)

# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()

# Correlation with output variable
cor_target = abs(cor["progression"])

# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)
Chỉnh sửa và Chạy Mã