river の硝酸イオンデータに Grubbs' 検定を適用したところ、異常と判定されたのは156行目のみでした。一方で Seasonal-Hybrid ESD では、さらに高い値の異常が2点見つかりました。次のうち、両手法の結果の違いを最もよく説明しているのはどれでしょうか。
river
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、数値要約やグラフ要約を使って、データに通常と異なる点が含まれていないかを非形式的に評価する方法を学びます。さらに、Grubbs 検定という統計的手続きを用いて特定の点が外れ値かどうかを確認し、時系列データにおける外れ値の特定に役立つ Seasonal-Hybrid ESD アルゴリズムについても学びます。
現在の演習
この章では、多変量データに対して各データ点の連続的な異常スコアを構成するために用いられる k-nearest neighbors 距離と local outlier factor の計算方法を学びます。さらに、ローカルな異常とグローバルな異常の違い、それぞれのケースでこれら2つのアルゴリズムがどのように役立つかを理解します。
k-nearest neighbors 距離と local outlier factor は、最近傍点までの距離や相対的な密度に基づいて各点をスコアリングします。この章では、代替となる木構造ベースの手法である isolation forest を取り上げます。これはデータをランダムに分割して小さな領域へと細分化していく過程で、各点がどれだけ容易に分離できるかを測る、迅速かつ堅牢な異常検知手法です。
これまでに、いくつかの異常スコアリング手法を紹介してきました。最終章では、ラベル付きの異常が利用できる場合に、各アルゴリズムの検出性能を比較する方法を学びます。異常スコアに対する precision(適合率)と recall(再現率)の計算と解釈、そしてカテゴリ型特徴量を含むデータにも対応できるようアルゴリズムを調整する方法を身につけます。