เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การใช้ค่าความน่าจะเป็นของ outlier

อีกวิธีหนึ่งในการระบุ outlier นอกเหนือจากการใช้ contamination คือการใช้ค่าความน่าจะเป็นของ outlier ข้อดีของวิธีนี้คือสามารถกำหนด threshold ความน่าจะเป็นได้อย่างอิสระ ซึ่งช่วยให้ควบคุมระดับความมั่นใจในการทำนายได้ตามต้องการ

โหลด IForest และ big_mart ไว้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การตรวจจับความผิดปกติใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • คำนวณค่าความน่าจะเป็นสำหรับทั้ง inlier และ outlier
  • ดึงค่าความน่าจะเป็นของ outlier ออกมาเก็บไว้ใน outlier_probs
  • กรอง outlier ลงใน outliers โดยใช้ threshold ที่ 70% บน outlier_probs

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

iforest = IForest(random_state=10).fit(big_mart)

# Calculate probabilities
probs = iforest.____

# Extract the probabilities for outliers
outlier_probs = ____[____]

# Filter for when the probability is higher than 70%
outliers = ____[____]

print(len(outliers))
แก้ไขและรันโค้ด