НачатьНачать бесплатно

Заполнение пропущенных значений с помощью перцентилей

В этом упражнении вы продолжите практиковаться в заполнении пропущенных значений. Однако в отличие от предыдущего упражнения вместо средних значений вы будете использовать перцентили. Перцентили — удобный способ получить консервативные оценки для заполнения пропусков. Этот процесс включает следующие шаги:

  • Удалите пропущенные значения из интересующего столбца.
  • Вычислите, например, 70-й перцентиль оставшихся значений этого столбца.
  • Наихудшее значение 70-го перцентиля зависит от конкретного столбца:
    • Например, большой объём активов считается положительным показателем, а малый — отрицательным. Поэтому наихудшее значение 70-го перцентиля для активов соответствует их 30-му перцентилю.
    • Аналогично, высокий уровень обязательств считается плохим показателем. Поэтому наихудшее значение 70-го перцентиля для обязательств — это просто их 70-й перцентиль.

Библиотека pandas загружена с псевдонимом pd, а NumPy — с псевдонимом np. Для вас уже загружен DataFrame pandas с именем dataset. Он содержит столбец "Total Current Liabilities", в котором есть пропущенные значения.

Это упражнение является частью курса

Анализ финансовой отчётности на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Impute missing value with 70th percentile non-missing values of company
impute_by_company = ___

# Impute missing value with 70th percentile non-missing values of industry
impute_by_comp_type = ____

print(impute_by_company)
print(impute_by_comp_type)
Редактировать и запускать код