मूल डेटा से SMOTE की तुलना करें
पिछले अभ्यास में, आपने देखा कि SMOTE उपयोग करने से अचानक अल्पसंख्यक क्लास के और अवलोकन मिल जाते हैं। आइए उन नतीजों की हमारे मूल डेटा से तुलना करें, ताकि साफ़ समझ बन सके कि वास्तव में क्या हुआ। पुराने और नए डेटा के value counts फिर से देखें, और दोनों के scatter plots को साथ-साथ प्लॉट करें। इसके लिए आप पहले से परिभाषित फंक्शन compare_plot() का उपयोग करेंगे, जो ये आर्ग्युमेंट लेता है: X, y, X_resampled, y_resampled, method=''. यह फंक्शन आपके मूल डेटा को एक scatter plot में और resampled डेटा को उसके बगल में प्लॉट करता है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Fraud Detection
अभ्यास निर्देश
- हमारे मूल लेबल
yके value counts प्रिंट करें। ध्यान रखें किyअभी एक Numpy array है, इसलिए value counts इस्तेमाल करने के लिए हमyको वापस pandas Series ऑब्जेक्ट के रूप में असाइन करेंगे। - यही कदम दोहराएँ और
y_resampledपर value counts प्रिंट करें। इससे आपको दिखेगा कि SMOTE के साथ दोनों क्लासों के बीच बैलेंस कैसे बदला है। - प्री-डिफ़ाइंड
compare_plot()फंक्शन का उपयोग करके हमारे मूल डेटा और resampled डेटा पर कॉल करें, ताकि दोनों scatterplots साथ-साथ दिखें।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Print the value_counts on the original labels y
print(pd.value_counts(pd.Series(____)))
# Print the value_counts
print(____(____(____)))
# Run compare_plot
compare_plot(____, ____, ____, ____, method='SMOTE')