Gói gọn bước điền khuyết & mô hình hóa trong một hàm
Bất cứ khi nào bạn phân tích hay mô hình hóa trên dữ liệu đã được điền khuyết, bạn cần tính đến mức độ bất định do quá trình điền khuyết. Chạy một mô hình trên bộ dữ liệu chỉ được điền khuyết một lần sẽ bỏ qua thực tế rằng việc điền khuyết chỉ ước lượng các giá trị thiếu với sự bất định. Sai số chuẩn từ những mô hình như vậy thường quá nhỏ. Giải pháp là điền khuyết nhiều lần, và một cách để thực hiện là dùng bootstrapping.
Trong các bài tập sắp tới, bạn sẽ làm việc với dữ liệu quen thuộc biopics. Mục tiêu là dùng điền khuyết nhiều lần bằng bootstrapping và hồi quy tuyến tính để xem, dựa trên dữ liệu hiện có, liệu phim tiểu sử về nữ có kiếm ít hơn so với về nam hay không.
Hãy bắt đầu bằng cách viết một hàm tạo mẫu bootstrap, điền khuyết mẫu đó và khớp một mô hình hồi quy tuyến tính.
Bài tập này là một phần của khóa học
Xử lý dữ liệu khuyết bằng Imputation trong R
Hướng dẫn bài tập
- Cắt lát
datađể lấy lại mẫu các hàng theoindicesvà gán kết quả chodata_boot. - Điền khuyết mẫu bootstrap
data_bootbằng kNN với 5 láng giềng và gán kết quả chodata_imp. - Khớp một mô hình hồi quy tuyến tính cho
data_impgiải thíchearningstheosub_sex,sub_typevàyear.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
calc_gender_coef <- function(data, indices) {
# Get bootstrap sample
data_boot <- data[___, ]
# Impute with kNN imputation
data_imp <- ___
# Fit linear regression
linear_model <- ___
# Extract and return gender coefficient
gender_coefficient <- coef(linear_model)[2]
return(gender_coefficient)
}