Bắt đầu ngayBắt đầu miễn phí

Tóm tắt theo nhóm về mức độ thiếu dữ liệu

Giờ bạn đã có thể tạo dữ liệu nabular, hãy dùng nó để khám phá dữ liệu. Ta sẽ tính các thống kê tóm tắt dựa trên mức độ thiếu của một biến khác.

Để làm điều này, ta sẽ thực hiện các bước sau:

  • Đầu tiên, bind_shadow() biến dữ liệu thành dữ liệu nabular.

  • Tiếp theo, thực hiện một số phép tóm tắt trên dữ liệu bằng group_by()summarize() để tính trung bình và độ lệch chuẩn, dùng các hàm mean()sd().

Bài tập này là một phần của khóa học

Xử lý dữ liệu thiếu trong R

Xem khóa học

Hướng dẫn bài tập

  • Với bộ dữ liệu oceanbuoys:

  • Gọi bind_shadow(), rồi group_by() theo tình trạng thiếu của humidity (humidity_NA) và tính trung bình cùng độ lệch chuẩn cho gió đông tây (wind_ew) bằng summarize() từ dplyr.

  • Lặp lại, nhưng tính các tóm tắt cho gió bắc nam (wind_ns).

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# `bind_shadow()` and `group_by()` humidity missingness (`humidity_NA`)
oceanbuoys %>%
  ___() %>%
  group_by(___) %>% 
  summarize(wind_ew_mean = mean(___), # calculate mean of wind_ew
            wind_ew_sd = ___)) # calculate standard deviation of wind_ew
  
# Repeat this, but calculating summaries for wind north south (`wind_ns`).
___ %>%
  ___ %>%
  group_by(___) %>%
  summarize(___ = ___(___),
            ___ = ___(___))
Chỉnh sửa và Chạy Mã