or
Bài tập này là một phần của khóa học
Học cách khám phá các nhóm (hay "cụm") tiềm ẩn trong một tập dữ liệu. Kết thúc chương này, bạn sẽ phân cụm các công ty dựa trên giá cổ phiếu của họ và phân biệt các loài khác nhau bằng cách phân cụm theo các phép đo.
Trong chương này, bạn sẽ học hai kỹ thuật unsupervised learning để trực quan hóa dữ liệu: phân cụm phân cấp và t-SNE. Phân cụm phân cấp gộp các mẫu dữ liệu vào các cụm ngày càng thô hơn, tạo ra một sơ đồ cây thể hiện thứ bậc các cụm. t-SNE ánh xạ các mẫu dữ liệu vào không gian 2D để bạn có thể trực quan hóa mức độ gần nhau giữa các mẫu.
Giảm chiều tóm tắt một tập dữ liệu bằng các mẫu lặp lại phổ biến của nó. Trong chương này, bạn sẽ học về kỹ thuật giảm chiều nền tảng nhất, "Principal Component Analysis" ("PCA"). PCA thường được dùng trước supervised learning để cải thiện hiệu suất và khả năng khái quát hóa của mô hình. Nó cũng hữu ích cho unsupervised learning. Ví dụ, bạn sẽ dùng một biến thể của PCA cho phép bạn phân cụm các bài viết Wikipedia theo nội dung!
Trong chương này, bạn sẽ học về một kỹ thuật giảm chiều gọi là "Non-negative matrix factorization" ("NMF") giúp biểu diễn các mẫu như sự kết hợp của các phần có thể diễn giải. Chẳng hạn, nó biểu diễn tài liệu như sự kết hợp của các chủ đề, và hình ảnh theo các mẫu hình thị giác thường gặp. Bạn cũng sẽ học cách dùng NMF để xây dựng hệ gợi ý có thể tìm các bài viết tương tự để đọc, hoặc các nghệ sĩ âm nhạc phù hợp với lịch sử nghe của bạn!
Bài tập hiện tại