การอนุมานแบบมีและไม่มี Outlier (Randomization)
ด้วย Randomization Test สามารถประเมินผลกระทบของ Outlier ต่อข้อสรุปเชิงอนุมานของโมเดลเชิงเส้นได้อีกครั้ง ลอง Randomization Test กับข้อมูล hypdata_out สองครั้ง: ครั้งแรกโดยใช้ข้อมูลที่มีค่า Outlier และครั้งที่สองโดยไม่มีค่า Outlier โดยโค้ดที่ยาวขึ้นนั้นช่วยอธิบายขั้นตอนของ Randomization Test ได้อย่างชัดเจน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การอนุมานสำหรับการถดถอยเชิงเส้นใน R
คำแนะนำการฝึกหัด
จาก Data Frame hypdata_out (ที่มี Outlier) และ hypdata_noout (ที่นำ Outlier ออกแล้ว) ได้สร้าง Data Frame perm_slope_out และ perm_slope_noout ขึ้นมาเพื่อเก็บค่า Slope ที่ได้จากการ Permute ของชุดข้อมูลต้นฉบับตามลำดับ ส่วนค่าที่สังเกตได้จริงนั้นเก็บไว้ในตัวแปร obs_slope_out และ obs_slope_noout
- หาค่า p-value โดยคำนวณสัดส่วนของค่า Slope ที่ Permute แล้ว (เทียบกับค่า
absolute) ที่มากกว่าหรือเท่ากับค่า Slope ที่สังเกตได้ (เทียบกับค่าabsolute) เช่นเดิม ให้ใช้meanกับนิพจน์อสมการแบบ Binary เพื่อหาสัดส่วนดังกล่าว
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Calculate the p-value with the outlier
perm_slope_out %>%
mutate(abs_perm_slope = ___) %>%
summarize(p_value = ___)
# Calculate the p-value without the outlier
perm_slope_noout %>%
mutate(abs_perm_slope = ___) %>%
summarize(p_value = ___)