Quy trình mice: mice - with - pool
Phương pháp thế khuyết nhiều lần theo phương trình xâu chuỗi (MICE) cho phép ước lượng mức độ bất định do thế khuyết bằng cách thế khuyết một bộ dữ liệu nhiều lần dựa trên mô hình và lấy mẫu từ các phân phối có điều kiện. Nhờ vậy, mỗi bộ dữ liệu đã thế khuyết sẽ hơi khác nhau. Sau đó, bạn sẽ phân tích trên từng bộ và gộp (pool) các kết quả lại, thu được các đại lượng quan tâm kèm theo khoảng tin cậy phản ánh bất định do thế khuyết.
Trong bài này, bạn sẽ luyện tập quy trình MICE điển hình: mice() - with() - pool(). Bạn sẽ chạy phân tích hồi quy trên dữ liệu biopics để xem nghề nghiệp của nhân vật, sub_type, nghề nào gắn với doanh thu phim cao nhất. Cùng “chơi với mice” nào!
Bài tập này là một phần của khóa học
Xử lý dữ liệu khuyết bằng Imputation trong R
Hướng dẫn bài tập
- Nạp gói
micevà thế khuyếtbiopicsbằngmice()với 5 lần thế khuyết, gán kết quả vàobiopics_multiimp. - Khớp mô hình hồi quy tuyến tính giải thích
earningstheoyearvàsub_typecho từng bộ dữ liệu đã thế khuyết, gán kết quả vàolm_multiimp. - Gộp (pool) các mô hình hồi quy đã lưu trong
lm_multiimplại với nhau, gán kết quả vàolm_pooled. - Tóm tắt
lm_pooledsao cho tạo ra khoảng tin cậy với mức tin cậy 95%.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load mice package
___
# Impute biopics with mice using 5 imputations
biopics_multiimp <- ___(___, m = ___, seed = 3108)
# Fit linear regression to each imputed data set
lm_multiimp <- ___(___, ___)
# Pool and summarize regression results
lm_pooled <- ___(___)
___(___, conf.int = ___, conf.level = ___)