Tính robust z-scores
Hãy cùng xem lại bộ dữ liệu transfers mà chúng ta đã dùng ở Chương 1.
Bộ dữ liệu có 222 giao dịch và có bốn trường hợp gian lận đã biết, được đánh dấu bằng 1 trong biến fraud_flag. Trước đây chúng ta đã nghiên cứu đặc trưng tần suất (frequency) và độ mới (recency).
Lần này, bạn sẽ chỉ tập trung vào biến amount và thử phát hiện gian lận bằng cách áp dụng các kỹ thuật phát hiện ngoại lai đơn biến lên biến này.
Đừng ngần ngại khám phá bộ dữ liệu trong Console nếu bạn cần ôn lại cấu trúc của nó. Bạn cũng có thể xem lại các slide để kiểm tra các hàm đã được giới thiệu trong video trước.
Bài tập này là một phần của khóa học
Phát hiện gian lận với R
Hướng dẫn bài tập
- Xác định những quan sát nào được gắn nhãn gian lận.
- Tính trung vị và độ lệch tuyệt đối trung vị (mad) cho biến
amount. - Dùng các ước lượng vững cho vị trí và phương sai để tính robust z-score cho từng quan sát.
- Những quan sát nào có robust z-score lớn hơn 3 theo giá trị tuyệt đối?
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Get observations identified as fraud
which(___ == ___)
# Compute median and mean absolute deviation for `amount`
m <- median(___)
s <- ___(___)
# Compute robust z-score for each observation
robzscore <- abs((___ - ___) / (___))
# Get observations with robust z-score higher than 3 in absolute value
which(abs(___) > ___)