contamination の選び方
コード自体は数行で書けますが、適切な contamination を見つけるには注意が必要です。
contamination パラメータは IForst の結果にのみ影響します。IForest が生の異常スコアを生成したあと、contamination に基づいて上位の n% の異常スコアを外れ値として選びます。たとえば 5% の contamination なら、異常スコアが上位 5% の観測値が外れ値として選ばれます。
チューニング方法については次の動画で説明しますが、ここではまず、このパラメータに任意の値を設定する練習をします。
データは big_mart として読み込まれています。
この演習はコースの一部です
Anomaly Detection in Python
演習の手順
contaminationを 5% に設定して、IForest()推定器をインスタンス化します。- そのインスタンスを Big Mart の売上データに対して学習(fit)させます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
from pyod.models.iforest import IForest
# Instantiate an instance with 5% contamination
iforest = ____
# Fit IForest to Big Mart sales data
____