शुरू करेंमुफ़्त में शुरू करें

बहुसंख्यक समूह को छोटा करना

डेटासेट में fraud केस बढ़ाने के बजाय, आप यादृच्छिक रूप से legitimate केस हटाकर डेटासेट को संतुलित कर सकते हैं. आइए creditcard डेटासेट में बहुसंख्यक क्लास (Class = 0) को under-sample करें. कंसोल में table() का उपयोग करके आप जान सकते हैं कि डेटासेट में कितने fraudulent और legitimate ट्रांज़ैक्शन हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Fraud Detection

पाठ्यक्रम देखें

अभ्यास निर्देश

  • ROSE लाइब्रेरी लोड करें.
  • n_new को under-sampled डेटासेट में आवश्यक केसों की संख्या के रूप में निर्दिष्ट करें ताकि नया डेटासेट 40% fraud केसों से बना हो. इसके लिए, आपको fraud केसों की संख्या को under-sampled डेटासेट में वांछित fraud प्रतिशत से भाग देना होगा.
  • डेटासेट को under-sample करें.
  • under-sampled डेटासेट के class-balance की जाँच के लिए table() और prop.table() का उपयोग करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load ROSE
___

# Calculate the required number of cases in the over-sampled dataset
n_new <- ___

# Under-sample
undersampling_result <- ___(formula = ___, data = ___,
                           ___ = ___, ___ = ___, seed = 2018)

# Verify the Class-balance of the under-sampled dataset
undersampled_credit <- undersampling_result$___
___(___(___))
कोड संपादित करें और चलाएँ