НачатьНачать бесплатно

Замена пропущенных значений в кредитных данных

Теперь проверьте данные на наличие пропусков. Если пропущенные значения обнаружатся в столбце loan_status, использовать такие данные для прогнозирования вероятности дефолта не получится: неизвестно, был ли кредит погашен или нет. Пропуски в столбце person_emp_length менее критичны, однако они всё равно могут приводить к ошибкам при обучении модели.

Проверьте наличие пропущенных значений в столбце person_emp_length и замените их медианой.

Набор данных cr_loan уже загружен в рабочей области.

Это упражнение является частью курса

Моделирование кредитного риска на Python

Посмотреть курс

Инструкции к упражнению

  • Выведите массив с названиями столбцов, содержащих пропущенные значения, с помощью .isnull().
  • Выведите первые пять строк набора данных, в которых отсутствуют значения для person_emp_length.
  • Замените пропущенные значения медианой стажа занятости, используя метод .fillna().
  • Постройте гистограмму столбца person_emp_length, чтобы оценить распределение данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Print a null value column array
print(____.columns[____.____().any()])

# Print the top five rows with nulls for employment length
print(____[____[____].____()].head())

# Impute the null values with the median value for all employment lengths
____[____].____((cr_loan['person_emp_length'].____()), inplace=True)

# Create a histogram of employment length
n, bins, patches = plt.____(____[____], bins='auto', color='blue')
plt.xlabel("Person Employment Length")
plt.____()
Редактировать и запускать код