Hình ảnh hóa đầu tiên về dữ liệu thiếu
Không dễ để nắm được các giá trị thiếu nằm ở đâu trong dữ liệu, và đây chính là lúc trực quan hóa phát huy tác dụng.
Hàm vis_miss() tạo một biểu đồ tổng quan về mức độ thiếu trong dữ liệu. Hàm này cũng có tùy chọn gom cụm các hàng dựa trên tình trạng thiếu (cluster = TRUE), và tùy chọn sắp xếp các cột từ thiếu nhiều đến thiếu ít (sort_miss = TRUE).
Bài tập này là một phần của khóa học
Xử lý dữ liệu thiếu trong R
Hướng dẫn bài tập
Sử dụng bộ dữ liệu riskfactors từ naniar:
- Dùng
vis_miss()để trực quan hóa mức độ thiếu trong dữ liệu. - Dùng
vis_miss()vớicluster = TRUEđể khám phá một số cụm thiếu dữ liệu. - Dùng
vis_miss()và sắp xếp các giá trị thiếu vớisort_missđể sắp xếp các cột theo mức độ thiếu.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Visualize all of the missingness in the `riskfactors` dataset
vis_miss(___)
# Visualize and cluster all of the missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)
# visualize and sort the columns by missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)