การจัดกลุ่มตัวอย่างแบบไม่สุ่ม
บริษัทเกษตรแห่งหนึ่งกำลังทำการทดลองเพื่อวัดว่าการให้แกะกินหญ้าประเภทต่าง ๆ ส่งผลต่อน้ำหนักอย่างไร โดยขอให้คุณช่วยออกแบบการทดลองให้ถูกต้อง ผู้จัดการคนหนึ่งแนะนำว่าสามารถจัดกลุ่มตัวอย่างได้โดยเลือก 250 แถวแรกจาก DataFrame ก็เพียงพอแล้ว
หน้าที่ของคุณคือใช้ทักษะการวิเคราะห์เพื่อแสดงให้เห็นว่าวิธีนี้อาจไม่เหมาะสม โดยจัดกลุ่มตัวอย่างด้วยการกำหนดแบบไม่สุ่ม (250 แถวแรก) แล้วสังเกตความแตกต่างในสถิติเชิงพรรณนา
คุณได้รับ DataFrame ชื่อ weights ซึ่งมีคอลัมน์ weight บันทึกน้ำหนักของแกะ และคอลัมน์ id ที่ไม่ซ้ำกัน
ได้นำเข้า numpy และ pandas ในชื่อ np และ pd ตามลำดับ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การออกแบบการทดลองด้วย Python
คำแนะนำการฝึกหัด
- ใช้การแบ่ง DataFrame เพื่อเก็บ 250 แถวแรกของ
weightsไว้ในgroup1_non_randและเก็บแถวที่เหลือไว้ในgroup2_non_rand - สร้างสถิติเชิงพรรณนาของทั้งสองกลุ่ม แล้วเชื่อมเข้าด้วยกันเป็น DataFrame เดียว
- แสดงผลลัพธ์เพื่อสังเกตความแตกต่าง
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Non-random assignment
group1_non_rand = ____
group2_non_rand = ____
# Compare descriptive statistics of groups
compare_df_non_rand = ____([group1_non_rand['weight'].____, group2_non_rand['weight'].____], axis=1)
compare_df_non_rand.columns = ['group1', 'group2']
# Print to assess
print(____)