or
Bài tập này là một phần của khóa học
Trong chương này, bạn sẽ học cách dùng các tóm tắt số liệu và đồ họa để đánh giá không chính thức xem dữ liệu có chứa điểm bất thường hay không. Bạn sẽ sử dụng một thủ tục thống kê gọi là kiểm định Grubbs để kiểm tra liệu một điểm có phải là outlier, và tìm hiểu về thuật toán Seasonal-Hybrid ESD, giúp nhận diện outlier khi dữ liệu ở dạng chuỗi thời gian.
Trong chương này, bạn sẽ học cách tính khoảng cách k-nearest neighbors và local outlier factor, được dùng để xây dựng điểm số bất thường liên tục cho từng điểm dữ liệu khi dữ liệu có nhiều đặc trưng. Bạn cũng sẽ học sự khác nhau giữa bất thường cục bộ (local) và toàn cục (global), và cách mỗi thuật toán hỗ trợ trong từng trường hợp.
k-nearest neighbors distance và local outlier factor sử dụng khoảng cách hoặc mật độ tương đối của các láng giềng gần nhất để chấm điểm cho từng điểm dữ liệu. Trong chương này, bạn sẽ khám phá một cách tiếp cận thay thế dựa trên cây, gọi là isolation forest, một phương pháp nhanh và vững (robust) để phát hiện bất thường bằng cách đo lường mức độ dễ dàng tách biệt các điểm thông qua việc chia ngẫu nhiên dữ liệu thành các vùng ngày càng nhỏ.
Bạn đã được giới thiệu một vài thuật toán chấm điểm bất thường. Ở chương cuối này, bạn sẽ học cách so sánh hiệu quả phát hiện của các thuật toán trong các tình huống có sẵn nhãn bất thường. Bạn sẽ học cách tính và diễn giải các thống kê precision và recall cho một điểm số bất thường, và cách điều chỉnh các thuật toán để có thể xử lý dữ liệu có đặc trưng phân loại (categorical).
Bài tập hiện tại