LOF 和 isolation forest 都能以包含類別型特徵的資料進行訓練,但若先把這些特徵轉成 factor 會更容易。
在這個練習中,你會再次使用甲狀腺資料集。它包含了一些額外的類別型特徵,需要先轉換。
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
# Print the column classes in thyroid sapply(X = ___, FUN = ___)
在本章中,你將學習如何使用數值與圖形化摘要,非正式地評估資料是否包含不尋常的點。你會使用名為 Grubbs 檢定的統計程序來檢查某個點是否為離群值,並學習 Seasonal-Hybrid ESD 演算法,這能在資料為時間序列時協助找出離群值。
在本章中,你將學會計算 k-nearest neighbors 距離與 local outlier factor,這兩者可在資料具有多個特徵時,為每個資料點建立連續的異常分數。你也會理解區域性與全域性異常的差異,以及這兩種演算法在各種情況下如何提供協助。
k-nearest neighbors 距離與 local outlier factor 會利用最近鄰的距離或相對密度來為每個點評分。在本章中,你將探索另一種名為 isolation forest 的樹狀方法。這是一種快速且穩健的異常偵測方法,透過隨機將資料分割成越來越小的區域,來衡量資料點被分離的難易程度。
你已經認識了數種異常評分演算法。在最後一章,你將學會在有標記異常可用的情況下,比較各演算法的偵測效能。你會計算並解讀異常分數的 precision 與 recall 統計量,並了解如何調整演算法以容納含有類別型特徵的資料。
當前練習