Začněte nyníZačněte zdarma

Nahrazování chybějících úvěrových dat

Teď je čas zkontrolovat, zda v datech nechybí nějaké hodnoty. Pokud by chyběly hodnoty ve sloupci loan_status, nemohl/a bys tato data použít k předpovídání pravděpodobnosti defaultu – prostě bys nevěděl/a, zda k defaultu došlo, nebo ne. Chybějící hodnoty ve sloupci person_emp_length by sice nebyly tak kritické, ale i tak by způsobovaly chyby při trénování modelu.

Zkontroluj tedy, zda ve sloupci person_emp_length chybí nějaké hodnoty, a případně je nahraď mediánem.

Dataset cr_loan je již načtený v pracovním prostředí.

Toto cvičení je součástí kurzu

Credit Risk Modeling in Python

Zobrazit kurz

Pokyny k cvičení

  • Pomocí .isnull() vypiš pole názvů sloupců, které obsahují chybějící hodnoty.
  • Vypiš prvních pět řádků datasetu, kde chybí hodnota ve sloupci person_emp_length.
  • Chybějící hodnoty nahraď mediánem délky zaměstnání pomocí .fillna().
  • Vytvoř histogram sloupce person_emp_length a zkontroluj rozložení dat.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Print a null value column array
print(____.columns[____.____().any()])

# Print the top five rows with nulls for employment length
print(____[____[____].____()].head())

# Impute the null values with the median value for all employment lengths
____[____].____((cr_loan['person_emp_length'].____()), inplace=True)

# Create a histogram of employment length
n, bins, patches = plt.____(____[____], bins='auto', color='blue')
plt.xlabel("Person Employment Length")
plt.____()
Upravit a spustit kód