Przepływ mice: mice - with - pool
Wielokrotna imputacja metodą równań łańcuchowych, czyli MICE, pozwala oszacować niepewność wynikającą z imputacji. Polega na wielokrotnym imputowaniu zbioru danych metodą opartą na modelu, z losowaniem z warunkowych rozkładów prawdopodobieństwa. Dzięki temu każdy imputowany zbiór danych jest nieco inny. Następnie na każdym z nich przeprowadza się analizę, a wyniki są łączone (pooling), co daje interesujące wielkości statystyczne wraz z przedziałami ufności uwzględniającymi niepewność imputacji.
W tym ćwiczeniu przećwiczysz typowy przepływ pracy z pakietem MICE: mice() – with() – pool(). Przeprowadzisz analizę regresji na zbiorze danych biopics, aby sprawdzić, jakie zajęcie badanego podmiotu (sub_type) wiąże się z najwyższymi przychodami z filmów. Do dzieła!
To ćwiczenie jest częścią kursu
Obsługa brakujących danych z imputacją w R
Instrukcje do ćwiczenia
- Wczytaj pakiet
micei wykonaj imputację zbiorubiopicsza pomocą funkcjimice(), stosując 5 imputacji. Wynik przypisz do zmiennejbiopics_multiimp. - Dopasuj model regresji liniowej wyjaśniający
earningsna podstawie zmiennychyearisub_typedo każdego imputowanego zbioru danych. Wynik przypisz do zmiennejlm_multiimp. - Połącz modele regresji zapisane w
lm_multiimpmetodą poolingu. Wynik przypisz do zmiennejlm_pooled. - Podsumuj
lm_pooledw taki sposób, aby uzyskać przedziały ufności na poziomie 95%.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load mice package
___
# Impute biopics with mice using 5 imputations
biopics_multiimp <- ___(___, m = ___, seed = 3108)
# Fit linear regression to each imputed data set
lm_multiimp <- ___(___, ___)
# Pool and summarize regression results
lm_pooled <- ___(___)
___(___, conf.int = ___, conf.level = ___)