Tóm tắt theo nhóm về mức độ thiếu dữ liệu
Giờ bạn đã có thể tạo dữ liệu nabular, hãy dùng nó để khám phá dữ liệu. Ta sẽ tính các thống kê tóm tắt dựa trên mức độ thiếu của một biến khác.
Để làm điều này, ta sẽ thực hiện các bước sau:
Đầu tiên,
bind_shadow()biến dữ liệu thành dữ liệu nabular.Tiếp theo, thực hiện một số phép tóm tắt trên dữ liệu bằng
group_by()vàsummarize()để tính trung bình và độ lệch chuẩn, dùng các hàmmean()vàsd().
Bài tập này là một phần của khóa học
Xử lý dữ liệu thiếu trong R
Hướng dẫn bài tập
Với bộ dữ liệu
oceanbuoys:Gọi
bind_shadow(), rồigroup_by()theo tình trạng thiếu của humidity (humidity_NA) và tính trung bình cùng độ lệch chuẩn cho gió đông tây (wind_ew) bằngsummarize()từ dplyr.Lặp lại, nhưng tính các tóm tắt cho gió bắc nam (
wind_ns).
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# `bind_shadow()` and `group_by()` humidity missingness (`humidity_NA`)
oceanbuoys %>%
___() %>%
group_by(___) %>%
summarize(wind_ew_mean = mean(___), # calculate mean of wind_ew
wind_ew_sd = ___)) # calculate standard deviation of wind_ew
# Repeat this, but calculating summaries for wind north south (`wind_ns`).
___ %>%
___ %>%
group_by(___) %>%
summarize(___ = ___(___),
___ = ___(___))