การใช้สถิติเพื่อกำหนดพฤติกรรมปกติ
จากแบบฝึกหัดก่อนหน้า เราพบว่าการฉ้อโกงพบได้บ่อยในหมวดหมู่ธุรกรรมบางประเภท แต่ยังไม่มีวิธีที่ชัดเจนในการแบ่งกลุ่มข้อมูล เช่น การแบ่งตามช่วงอายุ คราวนี้ลองมาดูยอดเงินเฉลี่ยของธุรกรรมปกติและธุรกรรมที่เป็นการฉ้อโกงเปรียบเทียบกัน เพื่อให้เห็นว่าธุรกรรมที่เป็นการฉ้อโกงแตกต่างจากธุรกรรมปกติอย่างไรในเชิงโครงสร้าง
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การตรวจจับการฉ้อโกงด้วย Python
คำแนะนำการฝึกหัด
- สร้าง dataframe ใหม่ 2 ชุด สำหรับข้อมูลที่เป็นการฉ้อโกงและไม่ใช่การฉ้อโกง โดยใช้
.locเพื่อกรองข้อมูลจากdfด้วยเงื่อนไข "fraud เท่ากับ 1" และ "fraud เท่ากับ 0" - พล็อตคอลัมน์
amountของ dataframe ที่สร้างขึ้นใหม่ในฟังก์ชัน histogram และกำหนด label ว่าfraudและnonfraudตามลำดับ
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create two dataframes with fraud and non-fraud data
df_fraud = df.____[df.____ == ____]
df_non_fraud = df.____[df.____ == ____]
# Plot histograms of the amounts in fraud and non-fraud data
plt.hist(____.____, alpha=0.5, label='____')
plt.hist(____.____, alpha=0.5, label='____')
plt.legend()
plt.show()