शुरू करेंमुफ़्त में शुरू करें

फ्रॉड से नॉन-फ्रॉड अनुपात जाँचना

इस अध्याय में, आप creditcard_sampledata.csv पर काम करेंगे, जो क्रेडिट कार्ड लेनदेन का डेटा रखने वाला एक डेटासेट है. सौभाग्य से, इन लेनदेन में फ्रॉड की घटनाएँ बेहद कम हैं.

हालाँकि, Machine Learning एल्गोरिदम आम तौर पर तब बेहतर काम करते हैं जब डेटासेट में मौजूद अलग-अलग क्लास लगभग बराबर मात्रा में हों. अगर फ्रॉड के मामले कम हैं, तो उन्हें पहचानना सीखने के लिए डेटा भी कम होगा. इसे क्लास असंतुलन (class imbalance) कहा जाता है, और यह फ्रॉड डिटेक्शन की प्रमुख चुनौतियों में से एक है.

आइए इस डेटासेट को एक्सप्लोर करें और इस क्लास असंतुलन की समस्या को देखें.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Fraud Detection

पाठ्यक्रम देखें

अभ्यास निर्देश

  • pandas को pd नाम से इम्पोर्ट करें, क्रेडिट कार्ड डेटा पढ़ें और उसे df में असाइन करें. यह आपके लिए कर दिया गया है.
  • df की जानकारी प्रिंट करने के लिए .info() का उपयोग करें.
  • 'Class' कॉलम में फ्रॉड और नॉन-फ्रॉड लेनदेन की गिनती पाने के लिए .value_counts() का उपयोग करें. परिणाम को occ में असाइन करें.
  • डेटासेट में कुल लेनदेन के मुकाबले फ्रॉडulent लेनदेन का अनुपात निकालें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import pandas and read csv
import pandas as pd
df = pd.read_csv("creditcard_data.csv")

# Explore the features available in your dataframe
print(df.____)

# Count the occurrences of fraud and no fraud and print them
occ = df['____'].____()
print(occ)

# Print the ratio of fraud cases
print(occ / ____)
कोड संपादित करें और चलाएँ