Nahrazování chybějících úvěrových dat
Teď je čas zkontrolovat, zda v datech nechybí nějaké hodnoty. Pokud by chyběly hodnoty ve sloupci loan_status, nemohl/a bys tato data použít k předpovídání pravděpodobnosti defaultu – prostě bys nevěděl/a, zda k defaultu došlo, nebo ne. Chybějící hodnoty ve sloupci person_emp_length by sice nebyly tak kritické, ale i tak by způsobovaly chyby při trénování modelu.
Zkontroluj tedy, zda ve sloupci person_emp_length chybí nějaké hodnoty, a případně je nahraď mediánem.
Dataset cr_loan je již načtený v pracovním prostředí.
Toto cvičení je součástí kurzu
Credit Risk Modeling in Python
Pokyny k cvičení
- Pomocí
.isnull()vypiš pole názvů sloupců, které obsahují chybějící hodnoty. - Vypiš prvních pět řádků datasetu, kde chybí hodnota ve sloupci
person_emp_length. - Chybějící hodnoty nahraď mediánem délky zaměstnání pomocí
.fillna(). - Vytvoř histogram sloupce
person_emp_lengtha zkontroluj rozložení dat.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print a null value column array
print(____.columns[____.____().any()])
# Print the top five rows with nulls for employment length
print(____[____[____].____()].head())
# Impute the null values with the median value for all employment lengths
____[____].____((cr_loan['person_emp_length'].____()), inplace=True)
# Create a histogram of employment length
n, bins, patches = plt.____(____[____], bins='auto', color='blue')
plt.xlabel("Person Employment Length")
plt.____()