or
Bài tập này là một phần của khóa học
Sẵn sàng đơn giản hóa các bộ dữ liệu lớn! Bạn sẽ học về thông tin, cách đánh giá tầm quan trọng của đặc trưng, và thực hành nhận diện các đặc trưng ít thông tin. Kết thúc chương, bạn sẽ hiểu sự khác nhau giữa chọn đặc trưng và trích xuất đặc trưng—hai cách tiếp cận để giảm chiều dữ liệu.
Tìm hiểu cách phân biệt các đặc trưng giàu thông tin và nghèo thông tin dựa trên tỷ lệ giá trị khuyết, phương sai và tương quan. Sau đó, bạn sẽ khám phá cách xây dựng các recipe của tidymodels để chọn đặc trưng bằng các chỉ báo thông tin này.
Chương ba giới thiệu sự khác biệt giữa các phương pháp chọn đặc trưng không giám sát và có giám sát. Bạn sẽ ôn lại cách dùng workflow của tidymodels để xây dựng mô hình. Tiếp đến, bạn sẽ thực hiện chọn đặc trưng có giám sát bằng hồi quy lasso và mô hình random forest.
Trong chương cuối, bạn sẽ hình thành trực giác vững chắc về trích xuất đặc trưng bằng cách hiểu cách các thành phần chính trích xuất và kết hợp thông tin quan trọng nhất từ các đặc trưng khác nhau. Sau đó, học và áp dụng ba loại trích xuất đặc trưng — phân tích thành phần chính (PCA), t-SNE và UMAP. Khám phá cách bạn có thể dùng các phương pháp trích xuất này như một bước tiền xử lý trong quy trình xây dựng mô hình với tidymodels.
Bài tập hiện tại