Začněte nyníZačněte zdarma

Kombinování a porovnávání různých imputačních modelů

Abychom mohli porovnat různé metody imputace, musíme je sloučit do jednoho datového rámce. Teď porovnáš tři různé přístupy k práci s chybějícími daty na datasetu oceanbuoys.

  • První metoda využívá pouze kompletní záznamy a je načtena jako ocean_cc.
  • Druhá metoda imputuje hodnoty pomocí lineárního modelu s předpověďmi založenými na větru a je načtena jako ocean_imp_lm_wind.

Třetí imputovaný dataset, ocean_imp_lm_all, vytvoříš pomocí lineárního modelu – imputuješ proměnné sea_temp_c, air_temp_c a humidity s využitím proměnných wind_ew, wind_ns, year, latitude, longitude.

Nakonec všechny datasety (ocean_cc, ocean_imp_lm_wind a ocean_imp_lm_all) spojíš dohromady a výsledek pojmenuješ bound_models.

Toto cvičení je součástí kurzu

Práce s chybějícími daty v R

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř imputovaný dataset ocean_imp_lm_all pomocí lineárního modelu a imputuj proměnné sea_temp_c, air_temp_c a humidity s využitím proměnných wind_ew, wind_ns, year, latitude, longitude.
  • Spoj všechny datasety do jednoho objektu a pojmenuj ho bound_models.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create an imputed dataset using a linear models
ocean_imp_lm_all <- bind_shadow(oceanbuoys) %>%
  add_label_shadow() %>%
  impute_lm(sea_temp_c ~ wind_ew + wind_ns + ___ + ___ + ___) %>%
  impute_lm(air_temp_c ~ wind_ew + wind_ns + ___ + ___ + ___) %>%
  impute_lm(humidity ~ wind_ew + wind_ns + ___ + ___ + ___)

# Bind the datasets
bound_models <- bind_rows(cc = ___,
                          imp_lm_wind = ___,
                          imp_lm_all = ___,
                          .id = "imp_model")
# Look at the models
bound_models
Upravit a spustit kód