or
Bài tập này là một phần của khóa học
Bạn sẽ được giới thiệu khái niệm giảm chiều dữ liệu và học khi nào, tại sao điều này lại quan trọng. Bạn sẽ học sự khác biệt giữa chọn đặc trưng và trích xuất đặc trưng, và sẽ áp dụng cả hai kỹ thuật cho việc khám phá dữ liệu. Chương kết thúc với bài học về t-SNE, một kỹ thuật trích xuất đặc trưng mạnh mẽ cho phép bạn trực quan hóa một bộ dữ liệu có số chiều lớn.
Bài tập hiện tại
Trong chương đầu tiên trong hai chương về chọn đặc trưng, bạn sẽ tìm hiểu về “lời nguyền chiều dữ liệu” và cách giảm chiều giúp bạn vượt qua vấn đề này. Bạn sẽ được giới thiệu nhiều kỹ thuật để phát hiện và loại bỏ các đặc trưng mang lại ít giá trị gia tăng cho bộ dữ liệu, hoặc vì chúng có độ biến thiên thấp, quá nhiều giá trị khuyết, hoặc tương quan mạnh với các đặc trưng khác.
Trong chương thứ hai về chọn đặc trưng, bạn sẽ học cách để các mô hình giúp bạn tìm ra những đặc trưng quan trọng nhất trong một bộ dữ liệu nhằm dự đoán một biến mục tiêu cụ thể. Ở bài học cuối của chương, bạn sẽ kết hợp gợi ý từ nhiều mô hình khác nhau để quyết định những đặc trưng nào đáng giữ lại.
Chương này đi sâu vào thuật toán giảm chiều được dùng phổ biến nhất, Principal Component Analysis (PCA). Bạn sẽ xây dựng trực giác về cách thức và lý do thuật toán này lại mạnh mẽ, và sẽ áp dụng nó cho cả khám phá dữ liệu lẫn tiền xử lý dữ liệu trong một pipeline mô hình. Bạn sẽ kết thúc với một ví dụ thú vị về nén ảnh.