ПочатиПочніть безкоштовно

Імпутація пропущених значень за перцентилями

У цій вправі ви продовжите вправлятися в імпутації пропущених значень. На відміну від попередньої вправи, тепер ви використаєте перцентилі замість середніх значень для розрахунку імпутацій. Використання перцентилів — чудовий спосіб отримати консервативні імпутації. Імпутація пропущених значень у стовпці за перцентилями передбачає такі кроки:

  • Видаліть пропущені значення зі стовпця, який вас цікавить.
  • Потім обчисліть, скажімо, 70-й перцентиль чисел зі стовпця, з якого ви щойно прибрали пропущені значення.
  • „70-й перцентиль гіршого значення" залежить від стовпця, для якого ви рахуєте перцентиль:
    • Наприклад, велика кількість активів — це добре, тож низька кількість активів — гірше. Отже, „70-й перцентиль гіршого значення" для активів фактично дорівнює 30-му перцентилю активів.
    • Аналогічно, велика сума зобов'язань — це погано. Тому „70-й перцентиль гіршого значення" для зобов'язань — це просто їхній 70-й перцентиль.

pandas завантажено з псевдонімом pd, а NumPy — з псевдонімом np. Для вас завантажено датафрейм pandas під назвою dataset. Він містить стовпець "Total Current Liabilities" із деякими пропущеними значеннями.

Ця вправа є частиною курсу

Аналіз фінансової звітності в Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Impute missing value with 70th percentile non-missing values of company
impute_by_company = ___

# Impute missing value with 70th percentile non-missing values of industry
impute_by_comp_type = ____

print(impute_by_company)
print(impute_by_comp_type)
Редагувати та запускати код