นัยสำคัญของความแตกต่างระหว่างสัดส่วน
การเดินทางด้วยจักรยานยังคงไม่แพร่หลายนัก แต่วอชิงตัน ดี.ซี. มีสัดส่วนที่น่าสนใจ และตัวเลขนี้เพิ่มขึ้นกว่า 1 เปอร์เซ็นต์ในช่วงไม่กี่ปีที่ผ่านมา แต่การเพิ่มขึ้นนี้มีนัยสำคัญทางสถิติหรือไม่? ในแบบฝึกหัดนี้ จะได้คำนวณค่าความคลาดเคลื่อนมาตรฐานของสัดส่วน จากนั้นคำนวณค่า Z-statistic แบบสองกลุ่มตัวอย่างของสัดส่วนดังกล่าว
สูตรสำหรับค่าความคลาดเคลื่อนมาตรฐาน (SE) ของสัดส่วน คือ:
$$SE_P = \frac{1}{N}\sqrt{SE_n^2 - P^2SE_N^2}$$
สูตรสำหรับค่า Z-statistic แบบสองกลุ่มตัวอย่าง คือ:
$$Z = \frac{x_1 - x_2}{\sqrt{SE_{x_1}^2 + SE_{x_2}^2}}$$
โหลด DataFrame dc ไว้แล้ว โดยมีคอลัมน์ (แสดงใน console) ที่เก็บค่าประมาณ (ลงท้ายด้วย "_est") และค่า Margin of Error (ลงท้ายด้วย "_moe") สำหรับจำนวนแรงงานทั้งหมดและผู้ใช้จักรยาน
นำเข้าฟังก์ชัน sqrt จากโมดูล numpy ไว้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python
คำแนะนำการฝึกหัด
- คำนวณ
bike_shareโดยหารจำนวนผู้ใช้จักรยานด้วยจำนวนแรงงานทั้งหมด - คำนวณค่า SE ของค่าประมาณผู้ใช้จักรยานและแรงงานทั้งหมด โดยหารค่า MOE ด้วย
Z_CRIT - คำนวณค่า SE ของสัดส่วน:
se_bikeคือค่า SE ของกลุ่มย่อย \(SE_n\),bike_shareคือสัดส่วน \(P\) และse_totalคือค่า SE ของประชากรทั้งหมด \(SE_N\) - คำนวณ \(Z\): \(x_1\) และ \(x_2\) คือค่า
bike_shareในปี 2017 และ 2011 ส่วน \(SE_{x_1}\) และ \(SE_{x_2}\) คือค่าse_pในปี 2017 และ 2011
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Set the critical Z score for 90% confidence
Z_CRIT = 1.645
# Calculate share of bike commuting
dc["bike_share"] = ____
# Calculate standard errors of the estimate from MOEs
dc["se_bike"] = ____
dc["se_total"] = ____
dc["se_p"] = sqrt(____**2 - ____**2 * ____**2)**0.5 / dc["total_est"]
# Calculate the two sample statistic between 2011 and 2017
Z = (dc[dc["year"] == 2017]["bike_share"] - ____) / \
sqrt(____**2 + ____**2)
print(Z_CRIT < Z)