Percentiles से missing values को इम्प्यूट करना
इस अभ्यास में, आप missing values को इम्प्यूट करने का अभ्यास जारी रखेंगे। पिछली बार के विपरीत, इस बार आप औसत के बजाय percentiles का उपयोग करके imputations निकालेंगे। Percentiles का उपयोग करना, conservative imputations पाने का एक अच्छा तरीका है। किसी कॉलम में percentiles की मदद से missing values इम्प्यूट करने के लिए ये कदम अपनाएँ:
- जिस कॉलम में दिलचस्पी है, उसमें से missing values हटा दें।
- फिर, उसी कॉलम के नंबरों का, मान लीजिए 70th percentile निकालें जिसमें से आपने missing values हटाई थीं।
- 70th percentile का "worst value" किस कॉलम से percentile निकाला गया है, इस पर निर्भर करता है:
- उदाहरण के लिए, अधिक assets होना अच्छा माना जाता है, इसलिए assets का कम होना बुरा है। Assets का 70th percentile वाला "worst value" असल में assets का 30th percentile होता है।
- इसी तरह, liabilities का अधिक होना बुरा माना जाता है। तो liabilities का 70th "worst value" सीधा उसका 70th percentile ही होगा।
pandas को pd उपनाम से और NumPy को np उपनाम से लोड किया गया है। आपके लिए dataset नाम का एक pandas DataFrame लोड किया गया है। इसमें "Total Current Liabilities" कॉलम है, जिसमें कुछ missing values हैं।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Financial Statements का विश्लेषण
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Impute missing value with 70th percentile non-missing values of company
impute_by_company = ___
# Impute missing value with 70th percentile non-missing values of industry
impute_by_comp_type = ____
print(impute_by_company)
print(impute_by_comp_type)