Объединение и сравнение нескольких моделей импутации
Чтобы оценить различные методы импутации, необходимо объединить их в один фрейм данных. Далее вы сравните три подхода к обработке пропущенных значений на основе набора данных oceanbuoys.
- Первый метод использует только полные наблюдения и загружен как
ocean_cc. - Второй метод выполняет импутацию значений с помощью линейной модели, в которой прогнозы строятся на основе данных о ветре; он загружен как
ocean_imp_lm_wind.
Вы создадите третий импутированный набор данных, ocean_imp_lm_all, используя линейную модель: переменные sea_temp_c, air_temp_c и humidity будут импутированы на основе переменных wind_ew, wind_ns, year, latitude, longitude.
Затем вы объедините все три набора данных (ocean_cc, ocean_imp_lm_wind и ocean_imp_lm_all) в один объект под названием bound_models.
Это упражнение является частью курса
Работа с пропущенными данными в R
Инструкции к упражнению
- Создайте импутированный набор данных
ocean_imp_lm_allс помощью линейной модели, выполнив импутацию переменныхsea_temp_c,air_temp_cиhumidityна основе переменныхwind_ew,wind_ns,year,latitude,longitude. - Объедините все наборы данных в один объект и назовите его
bound_models.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create an imputed dataset using a linear models
ocean_imp_lm_all <- bind_shadow(oceanbuoys) %>%
add_label_shadow() %>%
impute_lm(sea_temp_c ~ wind_ew + wind_ns + ___ + ___ + ___) %>%
impute_lm(air_temp_c ~ wind_ew + wind_ns + ___ + ___ + ___) %>%
impute_lm(humidity ~ wind_ew + wind_ns + ___ + ___ + ___)
# Bind the datasets
bound_models <- bind_rows(cc = ___,
imp_lm_wind = ___,
imp_lm_all = ___,
.id = "imp_model")
# Look at the models
bound_models