Kiểm định t cho MAR: chuẩn bị dữ liệu
Bạn đã làm rất tốt khi phân loại các cơ chế dữ liệu thiếu ở bài trước! Trong ba cơ chế, MAR có lẽ là quan trọng nhất cần phát hiện, vì nhiều phương pháp bù khuyết (imputation) giả định dữ liệu là MAR. Vì vậy, bài này sẽ tập trung vào kiểm định MAR.
Bạn sẽ làm việc với dữ liệu quen thuộc biopics. Mục tiêu là kiểm tra xem số lượng giá trị thiếu trong earnings có khác nhau theo giới tính của nhân vật hay không. Ở bài này, bạn chỉ cần chuẩn bị dữ liệu cho kiểm định t. Trước hết, hãy tạo một biến giả (dummy) cho biết earnings bị thiếu hay không. Sau đó, bạn sẽ tách biến này theo giới tính bằng cách lọc dữ liệu để giữ một giới tính, rồi dùng pull() để lấy biến giả. Khi lọc, bạn có thể in head() của biopics ra console để quan sát biến giới tính.
Bài tập này là một phần của khóa học
Xử lý dữ liệu khuyết bằng Imputation trong R
Hướng dẫn bài tập
- Thêm vào
biopicsmột biến mới tênmissing_earningscó giá trịTRUEnếuearningsbị thiếu vàFALSEnếu không. - Tạo một vector các giá trị
missing_earningscho nam và gán vàomissing_earnings_males. - Tạo một vector các giá trị
missing_earningscho nữ và gán vàomissing_earnings_females.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a dummy variable for missing earnings
biopics <- biopics %>%
___(missing_earnings = ___(___))
# Pull the missing earnings dummy for males
missing_earnings_males <- biopics %>%
___(___) %>%
___(___)
# Pull the missing earnings dummy for females
missing_earnings_females <- biopics %>%
___(___) %>%
___(___)