Kom igångKom igång gratis

Ersätta saknade kreditdata

Nu är det dags att kontrollera om det finns saknade värden i datamängden. Om det saknas data i loan_status kan du inte använda den datan för att förutsäga sannolikheten för fallissemang, eftersom du inte vet om lånet var ett fallissemang eller inte. Saknade värden i person_emp_length är inte lika allvarligt, men skulle ändå orsaka fel vid träning.

Kontrollera därför om det finns saknade värden i kolumnen person_emp_length och ersätt eventuella saknade värden med medianen.

Datamängden cr_loan har laddats in i arbetsytan.

Den här övningen är en del av kursen

Kreditriskmodellering i Python

Visa kurs

Övningsinstruktioner

  • Skriv ut en array med kolumnnamn som innehåller saknade värden med hjälp av .isnull().
  • Skriv ut de fem översta raderna i datamängden som har saknade värden för person_emp_length.
  • Ersätt de saknade värdena med medianen för all anställningslängd med hjälp av .fillna().
  • Skapa ett histogram över kolumnen person_emp_length för att kontrollera fördelningen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Print a null value column array
print(____.columns[____.____().any()])

# Print the top five rows with nulls for employment length
print(____[____[____].____()].head())

# Impute the null values with the median value for all employment lengths
____[____].____((cr_loan['person_emp_length'].____()), inplace=True)

# Create a histogram of employment length
n, bins, patches = plt.____(____[____], bins='auto', color='blue')
plt.xlabel("Person Employment Length")
plt.____()
Redigera och kör kod