以下何者最適合描述為集合異常?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
在本章中,你將學習如何使用數值與圖形化摘要,非正式地評估資料是否包含不尋常的點。你會使用名為 Grubbs 檢定的統計程序來檢查某個點是否為離群值,並學習 Seasonal-Hybrid ESD 演算法,這能在資料為時間序列時協助找出離群值。
當前練習
在本章中,你將學會計算 k-nearest neighbors 距離與 local outlier factor,這兩者可在資料具有多個特徵時,為每個資料點建立連續的異常分數。你也會理解區域性與全域性異常的差異,以及這兩種演算法在各種情況下如何提供協助。
k-nearest neighbors 距離與 local outlier factor 會利用最近鄰的距離或相對密度來為每個點評分。在本章中,你將探索另一種名為 isolation forest 的樹狀方法。這是一種快速且穩健的異常偵測方法,透過隨機將資料分割成越來越小的區域,來衡量資料點被分離的難易程度。
你已經認識了數種異常評分演算法。在最後一章,你將學會在有標記異常可用的情況下,比較各演算法的偵測效能。你會計算並解讀異常分數的 precision 與 recall 統計量,並了解如何調整演算法以容納含有類別型特徵的資料。