शुरू करेंमुफ़्त में शुरू करें

वास्तविक दुनिया की लागत विश्लेषण

इस अभ्यास में आप अभी भी क्रेडिट डेटासेट पर ही काम करेंगे. याद रखें कि इस डेटासेट में "positive" का मतलब "bad credit" है, यानी वह ग्राहक जिसने अपना लोन डिफ़ॉल्ट किया, और "negative" का मतलब वह ग्राहक है जिसने बिना समस्या के भुगतान जारी रखा. बैंक मैनेजर ने आपको बताया कि बैंक को हर "good risk" ग्राहक से औसतन 10K का प्रॉफिट होता है, लेकिन हर "bad risk" ग्राहक से 150K का नुकसान होता है. आपका एल्गोरिदम आवेदकों को स्क्रीन करने के लिए इस्तेमाल होगा, इसलिए जिनको "negative" लेबल मिलेगा उन्हें लोन दिया जाएगा, और "positive" वालों को मना कर दिया जाएगा. आपके क्लासिफ़ायर की कुल लागत क्या है? डेटा X_train, X_test, y_train और y_test के रूप में उपलब्ध है. फ़ंक्शन confusion_matrix(), f1_score(), और precision_score() तथा RandomForestClassifier() उपलब्ध हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में मशीन लर्निंग वर्कफ़्लो डिज़ाइन करना

पाठ्यक्रम देखें

अभ्यास निर्देश

  • training डेटा पर एक random forest classifier फिट करें.
  • इसका उपयोग करके test डेटा को लेबल करें.
  • confusion_matrix() से false negatives और false positives निकालें. आपको मैट्रिक्स को flatten करना होगा.
  • किसी "good" ग्राहक को गलत तरह से "bad" क्लासिफ़ाई करने का मतलब है कि बैंक 10K प्रॉफिट कमाने का मौका खो देता. किसी "bad" ग्राहक को गलत तरह से "good" क्लासिफ़ाई करने का मतलब है कि ग्राहक के लोन डिफ़ॉल्ट करने से बैंक को 150K का नुकसान होगा.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Fit a random forest classifier to the training data
clf = ____(random_state=2).fit(____, ____)

# Label the test data
preds = clf.____(____)

# Get false positives/negatives from the confusion matrix
tn, ____, ____, tp = confusion_matrix(y_test, preds).____()

# Now compute the cost using the manager's advice
cost = fp*____ + fn*____
कोड संपादित करें और चलाएँ