मिसिंग क्रेडिट डेटा को बदलना
अब, आपको मिसिंग डेटा की जाँच करनी चाहिए. यदि loan_status में मिसिंग डेटा मिलता है, तो आप default की probability का पूर्वानुमान लगाने के लिए डेटा का उपयोग नहीं कर पाएँगे, क्योंकि आपको पता नहीं होगा कि लोन default हुआ था या नहीं. person_emp_length में मिसिंग डेटा उतना नुकसानदायक नहीं होगा, लेकिन फिर भी training errors का कारण बनेगा.
इसलिए, person_emp_length कॉलम में मिसिंग डेटा की जाँच करें और किसी भी मिसिंग वैल्यू को median से बदल दें.
डेटा सेट cr_loan workspace में लोड कर दिया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में क्रेडिट रिस्क मॉडलिंग
अभ्यास निर्देश
.isnull()का उपयोग करके उन कॉलम नामों की array प्रिंट करें जिनमें मिसिंग डेटा है.- उस डेटा सेट की शीर्ष पाँच पंक्तियाँ प्रिंट करें जिसमें
person_emp_lengthके लिए मिसिंग डेटा है. .fillna()का उपयोग करके सभी employment length के median से मिसिंग डेटा को बदलें.- वितरण जाँचने के लिए
person_emp_lengthकॉलम का एक histogram बनाएँ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Print a null value column array
print(____.columns[____.____().any()])
# Print the top five rows with nulls for employment length
print(____[____[____].____()].head())
# Impute the null values with the median value for all employment lengths
____[____].____((cr_loan['person_emp_length'].____()), inplace=True)
# Create a histogram of employment length
n, bins, patches = plt.____(____[____], bins='auto', color='blue')
plt.xlabel("Person Employment Length")
plt.____()