Заполнение пропущенных значений с помощью перцентилей
В этом упражнении вы продолжите практиковаться в заполнении пропущенных значений. Однако в отличие от предыдущего упражнения вместо средних значений вы будете использовать перцентили. Перцентили — удобный способ получить консервативные оценки для заполнения пропусков. Этот процесс включает следующие шаги:
- Удалите пропущенные значения из интересующего столбца.
- Вычислите, например, 70-й перцентиль оставшихся значений этого столбца.
- Наихудшее значение 70-го перцентиля зависит от конкретного столбца:
- Например, большой объём активов считается положительным показателем, а малый — отрицательным. Поэтому наихудшее значение 70-го перцентиля для активов соответствует их 30-му перцентилю.
- Аналогично, высокий уровень обязательств считается плохим показателем. Поэтому наихудшее значение 70-го перцентиля для обязательств — это просто их 70-й перцентиль.
Библиотека pandas загружена с псевдонимом pd, а NumPy — с псевдонимом np. Для вас уже загружен DataFrame pandas с именем dataset. Он содержит столбец "Total Current Liabilities", в котором есть пропущенные значения.
Это упражнение является частью курса
Анализ финансовой отчётности на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Impute missing value with 70th percentile non-missing values of company
impute_by_company = ___
# Impute missing value with 70th percentile non-missing values of industry
impute_by_comp_type = ____
print(impute_by_company)
print(impute_by_comp_type)