Імпутація пропущених даних
Пропущені дані трапляються. Якщо ми припускаємо, що наші дані пропущені повністю випадково, то вважаємо, що наявні дані добре представляють генеральну сукупність. Якщо пропусків небагато, їх можна видалити або замінити середнім чи медіаною. У цій вправі ми розглянемо 'PDOM': кількість днів на ринку за поточною ціною.
Ця вправа є частиною курсу
Опрацювання ознак у PySpark
Інструкції до вправи
- Отримайте кількість пропущених значень у стовпці
'PDOM', використовуючиwhere(),isNull()таcount(). - Обчисліть середнє значення
'PDOM'за допомогою агрегатної функціїmean(). - Використайте
fillna()зі значенням, встановленим на середнє'PDOM', і застосуйте його лише до стовпця'PDOM', використовуючи параметрsubset.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Count missing rows
missing = df.____(df[____].____()).____()
# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]
# Replacing with the mean value for that column
df.____(____, ____=[____])