이전 연습 문제에서 생성한 이상치 점수가 포함된 wine 데이터가 미리 로드되어 있어요.
wine
tree_score 열의 이상치 점수를 바탕으로 다음 문장 중 참인 것은 무엇인가요?
tree_score
이 연습은 강의의 일부입니다
이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요
이 장에서는 수치 요약과 그래프 요약을 사용해 데이터에 이상한 점이 있는지 비공식적으로 평가하는 방법을 배웁니다. Grubbs 검정이라는 통계적 절차를 사용해 특정 점이 이상치인지 확인하고, 시계열 데이터에서 이상치를 식별하는 데 도움이 되는 Seasonal-Hybrid ESD 알고리즘에 대해 알아봅니다.
이 장에서는 다변량 데이터에서 각 데이터 포인트에 연속적인 이상치 점수를 부여하는 데 사용되는 k-최근접 이웃 거리와 local outlier factor를 계산하는 방법을 학습합니다. 또한 국소 이상치와 전역 이상치의 차이를 이해하고, 두 알고리즘이 각각의 경우에 어떻게 도움이 되는지 알아봅니다.
k-최근접 이웃 거리와 local outlier factor는 최근접 이웃의 거리나 상대 밀도를 이용해 각 점의 점수를 매깁니다. 이 장에서는 대안적인 트리 기반 접근법인 isolation forest를 살펴보는데, 이는 데이터를 무작위로 더 작은 영역으로 분할하며 점들이 얼마나 쉽게 분리되는지를 측정해 빠르고 견고하게 이상치를 탐지하는 방법입니다.
현재 연습
이제 여러 가지 이상치 점수화 알고리즘을 소개받았습니다. 마지막 장에서는 레이블이 있는 이상치가 제공되는 경우 알고리즘의 탐지 성능을 비교하는 방법을 배웁니다. 이상치 점수에 대한 정밀도(precision)와 재현율(recall) 지표를 계산하고 해석하는 법, 그리고 범주형 특성이 있는 데이터를 처리하도록 알고리즘을 조정하는 방법을 익히게 됩니다.