การสรุปข้อมูลแบบกลุ่มตามค่าสูญหาย
เมื่อสร้าง nabular data ได้แล้ว ลองนำมาใช้สำรวจข้อมูลกัน โดยจะคำนวณสถิติสรุปตามค่าสูญหายของตัวแปรอื่น
ขั้นตอนมีดังนี้:
ขั้นแรก ใช้
bind_shadow()เพื่อแปลงข้อมูลให้เป็น nabular dataจากนั้น ใช้
group_by()และsummarize()เพื่อคำนวณค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐาน ด้วยฟังก์ชันmean()และsd()
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การจัดการข้อมูลที่หายไปใน R
คำแนะนำการฝึกหัด
สำหรับชุดข้อมูล
oceanbuoys:ใช้
bind_shadow()จากนั้นgroup_by()ตามค่าสูญหายของความชื้น (humidity_NA) แล้วคำนวณค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐานของลมทิศตะวันออก-ตะวันตก (wind_ew) ด้วยsummarize()จาก dplyrทำซ้ำขั้นตอนเดิม แต่คำนวณสถิติสรุปสำหรับลมทิศเหนือ-ใต้ (
wind_ns) แทน
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# `bind_shadow()` and `group_by()` humidity missingness (`humidity_NA`)
oceanbuoys %>%
___() %>%
group_by(___) %>%
summarize(wind_ew_mean = mean(___), # calculate mean of wind_ew
wind_ew_sd = ___)) # calculate standard deviation of wind_ew
# Repeat this, but calculating summaries for wind north south (`wind_ns`).
___ %>%
___ %>%
group_by(___) %>%
summarize(___ = ___(___),
___ = ___(___))