Začněte nyníZačněte zdarma

Postup v mice: mice - with - pool

Vícenásobná imputace řetězenými rovnicemi, neboli MICE, umožňuje odhadnout míru nejistoty plynoucí z imputace – datovou sadu imputuje vícekrát pomocí imputace založené na modelu, přičemž čerpá z podmíněných rozdělení. Každá imputovaná datová sada je tak trochu jiná. Na každé z nich se pak provede analýza a výsledky se sloučí dohromady, čímž získáme hledané hodnoty spolu s intervaly spolehlivosti, které odrážejí nejistotu imputace.

V tomto cvičení si procvičíš typický postup v mice: mice() - with() - pool(). Na datech biopics provedeš regresní analýzu, která odhalí, jaká profese subjektu, sub_type, je spojena s nejvyššími tržbami z filmů. Pojďme si s mice pohrát!

Toto cvičení je součástí kurzu

Práce s chybějícími daty pomocí imputace v R

Zobrazit kurz

Pokyny k cvičení

  • Načti balíček mice a imputuj datovou sadu biopics pomocí mice() s 5 imputacemi – výsledek ulož do proměnné biopics_multiimp.
  • Na každou imputovanou datovou sadu aplikuj lineární regresní model, který vysvětluje earnings pomocí year a sub_type – výsledek ulož do proměnné lm_multiimp.
  • Slučte regresní modely uložené v lm_multiimp dohromady pomocí poolingu – výsledek ulož do proměnné lm_pooled.
  • Shrň výsledky v lm_pooled tak, aby výstup obsahoval intervaly spolehlivosti na hladině 95 %.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load mice package
___

# Impute biopics with mice using 5 imputations
biopics_multiimp <- ___(___, m = ___, seed = 3108)

# Fit linear regression to each imputed data set 
lm_multiimp <- ___(___, ___)

# Pool and summarize regression results
lm_pooled <- ___(___)
___(___, conf.int = ___, conf.level = ___)
Upravit a spustit kód