प्रतिशत-आधारित आउट्लायर हटाना
यह सुनिश्चित करने का एक तरीका कि थोड़े-से डेटा का अत्यधिक नकारात्मक असर न पड़े, कॉलम में सबसे बड़े और/या सबसे छोटे मानों का एक निश्चित प्रतिशत हटाना है। यह संबंधित क्वांटाइल निकालकर और एक मास्क के साथ उसका उपयोग करके डेटा को ट्रिम करने से किया जा सकता है। यह तरीका खास तौर पर तब उपयोगी है जब आपको लगता है कि आपके डेटासेट के सबसे ऊँचे मानों से बचना चाहिए। इस तरीके का उपयोग करते समय याद रखें कि भले ही कोई आउट्लायर न हो, फिर भी यह डेटासेट से वही शीर्ष N प्रतिशत मान हटा देगा.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में मशीन लर्निंग के लिए फीचर इंजीनियरिंग
अभ्यास निर्देश
ConvertedSalaryकॉलम का 95वाँ क्वांटाइल निकालिए.so_numeric_dfDataFrame को इस तरह ट्रिम कीजिए कि केवल वे पंक्तियाँ रहें जिनमेंConvertedSalaryअपने 95वें क्वांटाइल से कम हो.so_numeric_df[['ConvertedSalary']]का हिस्टोग्राम प्लॉट कीजिए.trimmed_df[['ConvertedSalary']]का हिस्टोग्राम प्लॉट कीजिए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Find the 95th quantile
quantile = so_numeric_df['ConvertedSalary'].____(____)
# Trim the outliers
trimmed_df = so_numeric_df[so_numeric_df['ConvertedSalary'] < ____]
# The original histogram
so_numeric_df[['ConvertedSalary']].____()
plt.show()
plt.clf()
# The trimmed histogram
trimmed_df[['ConvertedSalary']].____()
plt.show()