Postup v mice: mice - with - pool
Vícenásobná imputace řetězenými rovnicemi, neboli MICE, umožňuje odhadnout míru nejistoty plynoucí z imputace – datovou sadu imputuje vícekrát pomocí imputace založené na modelu, přičemž čerpá z podmíněných rozdělení. Každá imputovaná datová sada je tak trochu jiná. Na každé z nich se pak provede analýza a výsledky se sloučí dohromady, čímž získáme hledané hodnoty spolu s intervaly spolehlivosti, které odrážejí nejistotu imputace.
V tomto cvičení si procvičíš typický postup v mice: mice() - with() - pool(). Na datech biopics provedeš regresní analýzu, která odhalí, jaká profese subjektu, sub_type, je spojena s nejvyššími tržbami z filmů. Pojďme si s mice pohrát!
Toto cvičení je součástí kurzu
Práce s chybějícími daty pomocí imputace v R
Pokyny k cvičení
- Načti balíček
micea imputuj datovou sadubiopicspomocímice()s 5 imputacemi – výsledek ulož do proměnnébiopics_multiimp. - Na každou imputovanou datovou sadu aplikuj lineární regresní model, který vysvětluje
earningspomocíyearasub_type– výsledek ulož do proměnnélm_multiimp. - Slučte regresní modely uložené v
lm_multiimpdohromady pomocí poolingu – výsledek ulož do proměnnélm_pooled. - Shrň výsledky v
lm_pooledtak, aby výstup obsahoval intervaly spolehlivosti na hladině 95 %.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load mice package
___
# Impute biopics with mice using 5 imputations
biopics_multiimp <- ___(___, m = ___, seed = 3108)
# Fit linear regression to each imputed data set
lm_multiimp <- ___(___, ___)
# Pool and summarize regression results
lm_pooled <- ___(___)
___(___, conf.int = ___, conf.level = ___)