Začněte nyníZačněte zdarma

Imputace průměrem pro teplotu

Imputace průměrem může být ošemetná záležitost. Pokud imputovaná proměnná koreluje s jinými proměnnými, imputované hodnoty mohou tuto korelaci narušit. Naznačilo to už předchozí cvičení, kde jsi analyzoval/a proměnnou air_temp.

Abys zjistil/a, jestli jsou tyto obavy oprávněné, provedeš v tomto cvičení imputaci průměrem na proměnné air_temp a zároveň vytvoříš binární indikátor označující místa, kde byly hodnoty imputovány. Přijde ti vhod v dalším cvičení, kde budeš hodnotit kvalitu své imputace. Pojďme doplnit chybějící hodnoty!

Toto cvičení je součástí kurzu

Práce s chybějícími daty pomocí imputace v R

Zobrazit kurz

Pokyny k cvičení

  • V pipeline upravující tao vytvoř novou proměnnou air_temp_imp, která bude TRUE, pokud air_temp chybí, a FALSE jinak.
  • Dále ve stejné pipeline přepiš air_temp jejím průměrem všude tam, kde chybí, a jinak ji ponech beze změny — výsledek přiřaď do tao_imp.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

tao_imp <- tao %>% 
  # Create a binary indicator for missing values in air_temp
  ___(air_temp_imp = ifelse(___(___), ___, ___)) %>% 
  # Impute air_temp with its mean
  ___(air_temp = ifelse(___(___), ___(___, na.rm = ___), ___))

# Print the first 10 rows of tao_imp
head(tao_imp, 10)
Upravit a spustit kód