始める無料で始める

contamination の選び方

コード自体は数行で書けますが、適切な contamination を見つけるには注意が必要です。

contamination パラメータは IForst の結果にのみ影響します。IForest が生の異常スコアを生成したあと、contamination に基づいて上位の n% の異常スコアを外れ値として選びます。たとえば 5% の contamination なら、異常スコアが上位 5% の観測値が外れ値として選ばれます。

チューニング方法については次の動画で説明しますが、ここではまず、このパラメータに任意の値を設定する練習をします。

データは big_mart として読み込まれています。

この演習はコースの一部です

Anomaly Detection in Python

コースを見る

演習の手順

  • contamination を 5% に設定して、IForest() 推定器をインスタンス化します。
  • そのインスタンスを Big Mart の売上データに対して学習(fit)させます。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

from pyod.models.iforest import IForest

# Instantiate an instance with 5% contamination
iforest = ____

# Fit IForest to Big Mart sales data
____
コードを編集して実行