Điền khuyết bằng random forests
Cách tiếp cận Machine Learning để điền khuyết có thể vừa chính xác hơn vừa dễ triển khai hơn so với các mô hình thống kê truyền thống. Trước hết, bạn không cần chỉ định mối quan hệ giữa các biến. Hơn nữa, các mô hình Machine Learning như random forests có thể khám phá những quan hệ phi tuyến, rất phức tạp và tận dụng chúng để dự đoán các giá trị bị thiếu.
Trong bài tập này, bạn sẽ làm quen với gói missForest, gói này xây một random forest riêng để dự đoán giá trị thiếu cho từng biến, lần lượt. Bạn sẽ gọi hàm điền khuyết trên dữ liệu phim tiểu sử, biopics, mà bạn đã làm việc cùng trước đó trong khóa học, rồi trích xuất dữ liệu đã điền cũng như sai số ước tính của phép điền khuyết.
Cùng “trồng” vài random forests nào!
Bài tập này là một phần của khóa học
Xử lý dữ liệu khuyết bằng Imputation trong R
Hướng dẫn bài tập
- Nạp gói
missForest. - Dùng
missForest()để điền giá trị khuyết trong dữ liệubiopics; gán kết quả vàoimp_res. - Trích xuất tập dữ liệu đã điền từ
imp_res, gán vàoimp_data, và kiểm tra xem số lượng giá trị khuyết có thực sự bằng không. - Trích xuất sai số điền khuyết ước tính từ
imp_res, gán vàoimp_err, và in ra console.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load the missForest package
___
# Impute biopics data using missForest
imp_res <- ___(___)
# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))
# Extract and print imputation errors
imp_err <- imp_res$___
print(___)