การใช้ค่าความน่าจะเป็นของ outlier
อีกวิธีหนึ่งในการระบุ outlier นอกเหนือจากการใช้ contamination คือการใช้ค่าความน่าจะเป็นของ outlier ข้อดีของวิธีนี้คือสามารถกำหนด threshold ความน่าจะเป็นได้อย่างอิสระ ซึ่งช่วยให้ควบคุมระดับความมั่นใจในการทำนายได้ตามต้องการ
โหลด IForest และ big_mart ไว้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การตรวจจับความผิดปกติใน Python
คำแนะนำการฝึกหัด
- คำนวณค่าความน่าจะเป็นสำหรับทั้ง inlier และ outlier
- ดึงค่าความน่าจะเป็นของ outlier ออกมาเก็บไว้ใน
outlier_probs - กรอง outlier ลงใน
outliersโดยใช้ threshold ที่ 70% บนoutlier_probs
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
iforest = IForest(random_state=10).fit(big_mart)
# Calculate probabilities
probs = iforest.____
# Extract the probabilities for outliers
outlier_probs = ____[____]
# Filter for when the probability is higher than 70%
outliers = ____[____]
print(len(outliers))