ПочатиПочніть безкоштовно

Імпутація пропущених даних

Пропущені дані трапляються. Якщо ми припускаємо, що наші дані пропущені повністю випадково, то вважаємо, що наявні дані добре представляють генеральну сукупність. Якщо пропусків небагато, їх можна видалити або замінити середнім чи медіаною. У цій вправі ми розглянемо 'PDOM': кількість днів на ринку за поточною ціною.

Ця вправа є частиною курсу

Опрацювання ознак у PySpark

Переглянути курс

Інструкції до вправи

  • Отримайте кількість пропущених значень у стовпці 'PDOM', використовуючи where(), isNull() та count().
  • Обчисліть середнє значення 'PDOM' за допомогою агрегатної функції mean().
  • Використайте fillna() зі значенням, встановленим на середнє 'PDOM', і застосуйте його лише до стовпця 'PDOM', використовуючи параметр subset.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Count missing rows
missing = df.____(df[____].____()).____()

# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]

# Replacing with the mean value for that column
df.____(____, ____=[____])
Редагувати та запускати код