अपने डेटा का प्लॉट बनाना
पिछले अभ्यास से हमें पता है कि fraud और non-fraud observations का अनुपात बहुत कम है। आप इसके बारे में कुछ कर सकते हैं, जैसे कि हमारे डेटा का re-sampling करना, जिसकी व्याख्या अगले वीडियो में की जाएगी.
इस अभ्यास में, आप डेटा देखेंगे और fraud बनाम non-fraud का अनुपात visualize करेंगे। fraud analysis में यह हमेशा एक अच्छी शुरुआत होती है कि किसी भी बदलाव से पहले पहले डेटा को देखें.
इसके अलावा, जब आप अपने सहकर्मियों से बात करते हैं, तो एक चित्र अक्सर यह स्पष्ट कर देता है कि हम बहुत ही imbalanced डेटा से जूझ रहे हैं। आइए df डेटासेट पर fraud से non-fraud डेटा पॉइंट्स के अनुपात को visualize करने के लिए एक plot बनाते हैं.
फ़ंक्शन prep_data() पहले से ही आपके workspace में लोड है, और matplotlib.pyplot को plt के रूप में इम्पोर्ट किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Fraud Detection
अभ्यास निर्देश
plot_data(X, y)फ़ंक्शन परिभाषित करें, जो दिए गए feature setXको labelsyके साथ एक scatter plot में अच्छे से plot करेगा। यह आपके लिए पहले से किया गया है.अपने डेटासेट
dfपरprep_data()फ़ंक्शन का उपयोग करके feature setXऔर labelsyबनाइए.अपने नए प्राप्त
Xऔरyपरplot_data()फ़ंक्शन चलाकर अपने परिणाम visualize कीजिए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
plt.legend()
return plt.show()
# Create X and y from the prep_data function
X, y = prep_data(____)
# Plot our data by running our plot data function on X and y
____(X, y)