Удаление пропущенных данных
Вы заменили пропущенные данные в столбце person_emp_length, однако в предыдущем упражнении вы увидели, что в loan_int_rate также есть пропуски.
Как и в случае с loan_status, наличие пропущенных значений в loan_int_rate затрудняет построение прогнозов.
Поскольку процентные ставки устанавливаются вашей компанией, пропуски в этом столбце выглядят очень странно. Возможно, они возникли из-за ошибок при загрузке данных, однако точно установить причину не получится. Пока лучше всего удалить такие записи с помощью .drop(), прежде чем двигаться дальше.
Набор данных cr_loan уже загружен в рабочую среду.
Это упражнение является частью курса
Моделирование кредитного риска на Python
Инструкции к упражнению
- Выведите количество записей, содержащих пропущенные значения процентной ставки.
- Создайте массив индексов строк с пропущенной процентной ставкой и назовите его
indices. - Удалите записи с пропущенными значениями процентной ставки и сохраните результат в
cr_loan_clean.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Print the number of nulls
print(____[____].____().____())
# Store the array on indices
____ = ____[____[____].____].____
# Save the new data without missing data
____ = ____.____(____)