MICE-flödet: mice - with - pool
Multipel imputation med kedjade ekvationer, eller MICE, gör det möjligt att uppskatta osäkerheten från imputering. Det sker genom att en datamängd imputeras flera gånger med modellbaserad imputation, medan värden dras från villkorliga fördelningar. På så sätt blir varje imputerad datamängd något annorlunda. Sedan genomförs en analys på var och en av dem och resultaten slås samman – vilket ger de intressanta storheterna tillsammans med konfidensintervall som återspeglar imputeringsosäkerheten.
I den här övningen får du öva på det typiska MICE-flödet: mice() - with() - pool(). Du genomför en regressionsanalys på datamängden biopics för att se vilken yrkesbakgrund, sub_type, hos biografiämnet som är kopplad till högst filminkomster. Nu kör vi!
Den här övningen är en del av kursen
Hantering av saknade värden med imputering i R
Övningsinstruktioner
- Läs in paketet
miceoch imputerabiopicsmedmice()med 5 imputationer. Tilldela resultatet tillbiopics_multiimp. - Anpassa en linjär regressionsmodell som förklarar
earningsmed hjälp avyearochsub_typepå varje imputerad datamängd. Tilldela resultatet tilllm_multiimp. - Sammanslå regressionsmodellerna sparade i
lm_multiimpoch tilldela resultatet tilllm_pooled. - Sammanfatta
lm_pooledså att det producerar konfidensintervall med 95% konfidensnivå.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load mice package
___
# Impute biopics with mice using 5 imputations
biopics_multiimp <- ___(___, m = ___, seed = 3108)
# Fit linear regression to each imputed data set
lm_multiimp <- ___(___, ___)
# Pool and summarize regression results
lm_pooled <- ___(___)
___(___, conf.int = ___, conf.level = ___)