अवांछित कैरेक्टर सँभालना (II)
पिछले अभ्यास में, आप df.head() कॉल देखकर जल्दी समझ गए थे कि कौन से कैरेक्टर समस्या पैदा कर रहे थे। कई बार यह इतना स्पष्ट नहीं होता। अक्सर किसी कॉलम के भीतर गहराई में ऐसे मान होते हैं जो कॉलम को न्यूमेरिक टाइप में कास्ट होने से रोकते हैं, जबकि आपको उसे मॉडल या आगे की फीचर इंजीनियरिंग में उपयोग करना होता है.
इन मानों को खोजने का एक तरीका यह है कि pd.to_numeric() का उपयोग करके कॉलम को मनचाहे डेटा टाइप में मजबूर करें, समस्या पैदा करने वाले मानों को NaN में बदल दें, फिर केवल उन पंक्तियों को फ़िल्टर करें जिनमें NaN हैं.
RawSalary कॉलम को float में कास्ट करने की कोशिश कीजिए और यह फेल होगा क्योंकि अब इसमें एक अतिरिक्त कैरेक्टर मिलेगा। उस कैरेक्टर को ढूँढें और हटाएँ ताकि कॉलम को float में कास्ट किया जा सके.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में मशीन लर्निंग के लिए फीचर इंजीनियरिंग
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Attempt to convert the column to numeric values
numeric_vals = ____(so_survey_df['RawSalary'], errors='coerce')
# Find the indexes of missing values
idx = ____
# Print the relevant rows
print(so_survey_df['RawSalary']____)