เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การใช้สถิติเพื่อกำหนดพฤติกรรมปกติ

จากแบบฝึกหัดก่อนหน้า เราพบว่าการฉ้อโกงพบได้บ่อยในหมวดหมู่ธุรกรรมบางประเภท แต่ยังไม่มีวิธีที่ชัดเจนในการแบ่งกลุ่มข้อมูล เช่น การแบ่งตามช่วงอายุ คราวนี้ลองมาดูยอดเงินเฉลี่ยของธุรกรรมปกติและธุรกรรมที่เป็นการฉ้อโกงเปรียบเทียบกัน เพื่อให้เห็นว่าธุรกรรมที่เป็นการฉ้อโกงแตกต่างจากธุรกรรมปกติอย่างไรในเชิงโครงสร้าง

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การตรวจจับการฉ้อโกงด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง dataframe ใหม่ 2 ชุด สำหรับข้อมูลที่เป็นการฉ้อโกงและไม่ใช่การฉ้อโกง โดยใช้ .loc เพื่อกรองข้อมูลจาก df ด้วยเงื่อนไข "fraud เท่ากับ 1" และ "fraud เท่ากับ 0"
  • พล็อตคอลัมน์ amount ของ dataframe ที่สร้างขึ้นใหม่ในฟังก์ชัน histogram และกำหนด label ว่า fraud และ nonfraud ตามลำดับ

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create two dataframes with fraud and non-fraud data 
df_fraud = df.____[df.____ == ____] 
df_non_fraud = df.____[df.____ == ____]

# Plot histograms of the amounts in fraud and non-fraud data 
plt.hist(____.____, alpha=0.5, label='____')
plt.hist(____.____, alpha=0.5, label='____')
plt.legend()
plt.show()
แก้ไขและรันโค้ด