Ersätta saknade kreditdata
Nu är det dags att kontrollera om det finns saknade värden i datamängden. Om det saknas data i loan_status kan du inte använda den datan för att förutsäga sannolikheten för fallissemang, eftersom du inte vet om lånet var ett fallissemang eller inte. Saknade värden i person_emp_length är inte lika allvarligt, men skulle ändå orsaka fel vid träning.
Kontrollera därför om det finns saknade värden i kolumnen person_emp_length och ersätt eventuella saknade värden med medianen.
Datamängden cr_loan har laddats in i arbetsytan.
Den här övningen är en del av kursen
Kreditriskmodellering i Python
Övningsinstruktioner
- Skriv ut en array med kolumnnamn som innehåller saknade värden med hjälp av
.isnull(). - Skriv ut de fem översta raderna i datamängden som har saknade värden för
person_emp_length. - Ersätt de saknade värdena med medianen för all anställningslängd med hjälp av
.fillna(). - Skapa ett histogram över kolumnen
person_emp_lengthför att kontrollera fördelningen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Print a null value column array
print(____.columns[____.____().any()])
# Print the top five rows with nulls for employment length
print(____[____[____].____()].head())
# Impute the null values with the median value for all employment lengths
____[____].____((cr_loan['person_emp_length'].____()), inplace=True)
# Create a histogram of employment length
n, bins, patches = plt.____(____[____], bins='auto', color='blue')
plt.xlabel("Person Employment Length")
plt.____()