เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การอนุมานแบบมีและไม่มี Outlier (Randomization)

ด้วย Randomization Test สามารถประเมินผลกระทบของ Outlier ต่อข้อสรุปเชิงอนุมานของโมเดลเชิงเส้นได้อีกครั้ง ลอง Randomization Test กับข้อมูล hypdata_out สองครั้ง: ครั้งแรกโดยใช้ข้อมูลที่มีค่า Outlier และครั้งที่สองโดยไม่มีค่า Outlier โดยโค้ดที่ยาวขึ้นนั้นช่วยอธิบายขั้นตอนของ Randomization Test ได้อย่างชัดเจน

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การอนุมานสำหรับการถดถอยเชิงเส้นใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

จาก Data Frame hypdata_out (ที่มี Outlier) และ hypdata_noout (ที่นำ Outlier ออกแล้ว) ได้สร้าง Data Frame perm_slope_out และ perm_slope_noout ขึ้นมาเพื่อเก็บค่า Slope ที่ได้จากการ Permute ของชุดข้อมูลต้นฉบับตามลำดับ ส่วนค่าที่สังเกตได้จริงนั้นเก็บไว้ในตัวแปร obs_slope_out และ obs_slope_noout

  • หาค่า p-value โดยคำนวณสัดส่วนของค่า Slope ที่ Permute แล้ว (เทียบกับค่า absolute) ที่มากกว่าหรือเท่ากับค่า Slope ที่สังเกตได้ (เทียบกับค่า absolute) เช่นเดิม ให้ใช้ mean กับนิพจน์อสมการแบบ Binary เพื่อหาสัดส่วนดังกล่าว

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Calculate the p-value with the outlier
perm_slope_out %>% 
  mutate(abs_perm_slope = ___) %>%
  summarize(p_value = ___)

# Calculate the p-value without the outlier
perm_slope_noout %>% 
  mutate(abs_perm_slope = ___) %>%
  summarize(p_value = ___)
แก้ไขและรันโค้ด