Imputace průměrem pro teplotu
Imputace průměrem může být ošemetná záležitost. Pokud imputovaná proměnná koreluje s jinými proměnnými, imputované hodnoty mohou tuto korelaci narušit. Naznačilo to už předchozí cvičení, kde jsi analyzoval/a proměnnou air_temp.
Abys zjistil/a, jestli jsou tyto obavy oprávněné, provedeš v tomto cvičení imputaci průměrem na proměnné air_temp a zároveň vytvoříš binární indikátor označující místa, kde byly hodnoty imputovány. Přijde ti vhod v dalším cvičení, kde budeš hodnotit kvalitu své imputace. Pojďme doplnit chybějící hodnoty!
Toto cvičení je součástí kurzu
Práce s chybějícími daty pomocí imputace v R
Pokyny k cvičení
- V pipeline upravující
taovytvoř novou proměnnouair_temp_imp, která budeTRUE, pokudair_tempchybí, aFALSEjinak. - Dále ve stejné pipeline přepiš
air_tempjejím průměrem všude tam, kde chybí, a jinak ji ponech beze změny — výsledek přiřaď dotao_imp.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
tao_imp <- tao %>%
# Create a binary indicator for missing values in air_temp
___(air_temp_imp = ifelse(___(___), ___, ___)) %>%
# Impute air_temp with its mean
___(air_temp = ifelse(___(___), ___(___, na.rm = ___), ___))
# Print the first 10 rows of tao_imp
head(tao_imp, 10)