在擬合 isolation tree 時,最重要的兩個函式是用來擬合的 iForest(),以及用來產生異常分數的 predict()。在這個練習中,你會用這兩個函式來探索 wine 資料集中的離群點。
iForest()
predict()
wine
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
# Build an isolation tree wine_tree <- iForest(___)
在本章中,你將學習如何使用數值與圖形化摘要,非正式地評估資料是否包含不尋常的點。你會使用名為 Grubbs 檢定的統計程序來檢查某個點是否為離群值,並學習 Seasonal-Hybrid ESD 演算法,這能在資料為時間序列時協助找出離群值。
在本章中,你將學會計算 k-nearest neighbors 距離與 local outlier factor,這兩者可在資料具有多個特徵時,為每個資料點建立連續的異常分數。你也會理解區域性與全域性異常的差異,以及這兩種演算法在各種情況下如何提供協助。
k-nearest neighbors 距離與 local outlier factor 會利用最近鄰的距離或相對密度來為每個點評分。在本章中,你將探索另一種名為 isolation forest 的樹狀方法。這是一種快速且穩健的異常偵測方法,透過隨機將資料分割成越來越小的區域,來衡量資料點被分離的難易程度。
當前練習
你已經認識了數種異常評分演算法。在最後一章,你將學會在有標記異常可用的情況下,比較各演算法的偵測效能。你會計算並解讀異常分數的 precision 與 recall 統計量,並了解如何調整演算法以容納含有類別型特徵的資料。