การพล็อตข้อมูล
จากแบบฝึกหัดที่แล้ว เราทราบแล้วว่าสัดส่วนของข้อมูลการฉ้อโกงเทียบกับข้อมูลปกตินั้นต่ำมาก ซึ่งเราสามารถแก้ไขปัญหานี้ได้ เช่น ด้วยการ re-sampling ข้อมูล ซึ่งจะอธิบายในวิดีโอถัดไป
ในแบบฝึกหัดนี้ จะได้ดูข้อมูลและ แสดงภาพสัดส่วนของข้อมูลการฉ้อโกงต่อข้อมูลปกติ การมองดูข้อมูลก่อนเสมอเป็นจุดเริ่มต้นที่ดีในการวิเคราะห์การฉ้อโกง ก่อนที่จะทำการเปลี่ยนแปลงใด ๆ
นอกจากนี้ เมื่อนำเสนอให้เพื่อนร่วมงาน การแสดงเป็นภาพกราฟิกมักช่วยให้เห็นได้ชัดเจนว่าข้อมูลมีความไม่สมดุลอย่างมาก
มาสร้างกราฟเพื่อแสดงสัดส่วนของข้อมูลการฉ้อโกงต่อข้อมูลปกติในชุดข้อมูล df กัน
ฟังก์ชัน prep_data() ถูกโหลดไว้ใน workspace แล้ว รวมถึง matplotlib.pyplot ในชื่อ plt
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การตรวจจับการฉ้อโกงด้วย Python
คำแนะนำการฝึกหัด
กำหนดฟังก์ชัน
plot_data(X, y)ที่จะพล็อต feature setXพร้อม labelyในรูปแบบ scatter plot อย่างเหมาะสม ส่วนนี้ได้เตรียมไว้ให้แล้วใช้ฟังก์ชัน
prep_data()กับชุดข้อมูลdfเพื่อสร้าง feature setXและ labelyรันฟังก์ชัน
plot_data()กับXและyที่ได้มาเพื่อแสดงผลลัพธ์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
plt.legend()
return plt.show()
# Create X and y from the prep_data function
X, y = prep_data(____)
# Plot our data by running our plot data function on X and y
____(X, y)