Uzupełnianie brakujących danych kredytowych
Teraz sprawdź, czy w danych są braki. Jeśli brakujące wartości wystąpią w kolumnie loan_status, nie będzie można ich wykorzystać do prognozowania prawdopodobieństwa niewywiązania się ze spłaty – nie wiadomo bowiem, czy dany kredyt był niespłacony, czy nie. Braki w kolumnie person_emp_length są mniej krytyczne, ale nadal mogą powodować błędy podczas trenowania modelu.
Sprawdź zatem, czy w kolumnie person_emp_length są brakujące wartości, i zastąp je medianą.
Zbiór danych cr_loan jest już wczytany w obszarze roboczym.
To ćwiczenie jest częścią kursu
Modelowanie ryzyka kredytowego w Pythonie
Instrukcje do ćwiczenia
- Wyświetl tablicę nazw kolumn zawierających brakujące dane przy użyciu
.isnull(). - Wyświetl pięć pierwszych wierszy zbioru danych, w których brakuje wartości w kolumnie
person_emp_length. - Zastąp brakujące wartości medianą długości zatrudnienia, używając
.fillna(). - Utwórz histogram kolumny
person_emp_length, aby sprawdzić rozkład danych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Print a null value column array
print(____.columns[____.____().any()])
# Print the top five rows with nulls for employment length
print(____[____[____].____()].head())
# Impute the null values with the median value for all employment lengths
____[____].____((cr_loan['person_emp_length'].____()), inplace=True)
# Create a histogram of employment length
n, bins, patches = plt.____(____[____], bins='auto', color='blue')
plt.xlabel("Person Employment Length")
plt.____()