शुरू करेंमुफ़्त में शुरू करें

प्रतिशत-आधारित आउट्लायर हटाना

यह सुनिश्चित करने का एक तरीका कि थोड़े-से डेटा का अत्यधिक नकारात्मक असर न पड़े, कॉलम में सबसे बड़े और/या सबसे छोटे मानों का एक निश्चित प्रतिशत हटाना है। यह संबंधित क्वांटाइल निकालकर और एक मास्क के साथ उसका उपयोग करके डेटा को ट्रिम करने से किया जा सकता है। यह तरीका खास तौर पर तब उपयोगी है जब आपको लगता है कि आपके डेटासेट के सबसे ऊँचे मानों से बचना चाहिए। इस तरीके का उपयोग करते समय याद रखें कि भले ही कोई आउट्लायर न हो, फिर भी यह डेटासेट से वही शीर्ष N प्रतिशत मान हटा देगा.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में मशीन लर्निंग के लिए फीचर इंजीनियरिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • ConvertedSalary कॉलम का 95वाँ क्वांटाइल निकालिए.
  • so_numeric_df DataFrame को इस तरह ट्रिम कीजिए कि केवल वे पंक्तियाँ रहें जिनमें ConvertedSalary अपने 95वें क्वांटाइल से कम हो.
  • so_numeric_df[['ConvertedSalary']] का हिस्टोग्राम प्लॉट कीजिए.
  • trimmed_df[['ConvertedSalary']] का हिस्टोग्राम प्लॉट कीजिए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Find the 95th quantile
quantile = so_numeric_df['ConvertedSalary'].____(____)

# Trim the outliers
trimmed_df = so_numeric_df[so_numeric_df['ConvertedSalary'] < ____]

# The original histogram
so_numeric_df[['ConvertedSalary']].____()
plt.show()
plt.clf()

# The trimmed histogram
trimmed_df[['ConvertedSalary']].____()
plt.show()
कोड संपादित करें और चलाएँ