Bắt đầu ngayBắt đầu miễn phí

Gói gọn bước điền khuyết & mô hình hóa trong một hàm

Bất cứ khi nào bạn phân tích hay mô hình hóa trên dữ liệu đã được điền khuyết, bạn cần tính đến mức độ bất định do quá trình điền khuyết. Chạy một mô hình trên bộ dữ liệu chỉ được điền khuyết một lần sẽ bỏ qua thực tế rằng việc điền khuyết chỉ ước lượng các giá trị thiếu với sự bất định. Sai số chuẩn từ những mô hình như vậy thường quá nhỏ. Giải pháp là điền khuyết nhiều lần, và một cách để thực hiện là dùng bootstrapping.

Trong các bài tập sắp tới, bạn sẽ làm việc với dữ liệu quen thuộc biopics. Mục tiêu là dùng điền khuyết nhiều lần bằng bootstrapping và hồi quy tuyến tính để xem, dựa trên dữ liệu hiện có, liệu phim tiểu sử về nữ có kiếm ít hơn so với về nam hay không.

Hãy bắt đầu bằng cách viết một hàm tạo mẫu bootstrap, điền khuyết mẫu đó và khớp một mô hình hồi quy tuyến tính.

Bài tập này là một phần của khóa học

Xử lý dữ liệu khuyết bằng Imputation trong R

Xem khóa học

Hướng dẫn bài tập

  • Cắt lát data để lấy lại mẫu các hàng theo indices và gán kết quả cho data_boot.
  • Điền khuyết mẫu bootstrap data_boot bằng kNN với 5 láng giềng và gán kết quả cho data_imp.
  • Khớp một mô hình hồi quy tuyến tính cho data_imp giải thích earnings theo sub_sex, sub_typeyear.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

calc_gender_coef <- function(data, indices) {
  # Get bootstrap sample
  data_boot <- data[___, ]
  # Impute with kNN imputation
  data_imp <- ___
  # Fit linear regression
  linear_model <- ___
  # Extract and return gender coefficient
  gender_coefficient <- coef(linear_model)[2]
  return(gender_coefficient)
}
Chỉnh sửa và Chạy Mã