外れ値確率の活用
contamination を使って外れ値を識別する代わりに、外れ値の確率を利用する方法があります。最大の利点は、任意の確率しきい値を選べることです。つまり、予測に対して望むだけ高い確信度を設定できます。
IForest と big_mart はすでに読み込まれています。
この演習はコースの一部です
Anomaly Detection in Python
演習の手順
- インライヤーと外れ値の両方の確率を計算します。
- 外れ値の確率を
outlier_probsに抽出します。 outlier_probsに 70% のしきい値を適用して、外れ値をoutliersにフィルタリングします。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
iforest = IForest(random_state=10).fit(big_mart)
# Calculate probabilities
probs = iforest.____
# Extract the probabilities for outliers
outlier_probs = ____[____]
# Filter for when the probability is higher than 70%
outliers = ____[____]
print(len(outliers))