शुरू करेंमुफ़्त में शुरू करें

आउटलायर संभालना

पिछले अभ्यास में, आपने देखा कि आउटलायर को विज़ुअलाइज़ करना मशीन लर्निंग इंटरव्यू में कैसे काम आता है। आउटलायर से निपटने का एक और सुविधाजनक तरीका Z-score निकालना है, जो ऐसे बिंदुओं के लिए थ्रेशोल्ड देता है जो औसत से लगभग +/-3 standard deviations दूर होते हैं.

इस अभ्यास में, आप scipy.stats मॉड्यूल का उपयोग करके stats.zscore() फंक्शन से Z-score निकालेंगे और mstats.winsorize() फंक्शन से Winsorizing तकनीक का उपयोग करके आउटलायर को बदलेंगे.

वीडियो लेसन से याद करें कि IQR के 1.5 गुना से ऊपर और/या नीचे आने वाले बिंदुओं को संभावित आउटलायर माना जाना चाहिए। इस अभ्यास के आखिरी स्टेप में, वह मान 2120 है.

ज़रूरी पैकेज आपके लिए इम्पोर्ट कर दिए गए हैं, और loan_data की numeric और categorical कॉलम्स को क्रमशः numeric_cols और categoric_cols के रूप में सबसेट करके सेव किया गया है.

Machine learning pipeline

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Machine Learning इंटरव्यू प्रश्नों का अभ्यास

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Print: before dropping
print(numeric_cols.mean())
print(numeric_cols.median())
print(numeric_cols.max())

# Create index of rows to keep
idx = (np.____(stats.____(____)) < 3).all(axis=1)

# Concatenate numeric and categoric subsets
ld_out_drop = pd.concat([numeric_cols.loc[____], categoric_cols.loc[____]], axis=1)

# Print: after dropping
print(ld_out_drop.mean())
print(ld_out_drop.median())
print(ld_out_drop.max())
कोड संपादित करें और चलाएँ