เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

นัยสำคัญของความแตกต่างระหว่างสัดส่วน

การเดินทางด้วยจักรยานยังคงไม่แพร่หลายนัก แต่วอชิงตัน ดี.ซี. มีสัดส่วนที่น่าสนใจ และตัวเลขนี้เพิ่มขึ้นกว่า 1 เปอร์เซ็นต์ในช่วงไม่กี่ปีที่ผ่านมา แต่การเพิ่มขึ้นนี้มีนัยสำคัญทางสถิติหรือไม่? ในแบบฝึกหัดนี้ จะได้คำนวณค่าความคลาดเคลื่อนมาตรฐานของสัดส่วน จากนั้นคำนวณค่า Z-statistic แบบสองกลุ่มตัวอย่างของสัดส่วนดังกล่าว

สูตรสำหรับค่าความคลาดเคลื่อนมาตรฐาน (SE) ของสัดส่วน คือ:

$$SE_P = \frac{1}{N}\sqrt{SE_n^2 - P^2SE_N^2}$$

สูตรสำหรับค่า Z-statistic แบบสองกลุ่มตัวอย่าง คือ:

$$Z = \frac{x_1 - x_2}{\sqrt{SE_{x_1}^2 + SE_{x_2}^2}}$$

โหลด DataFrame dc ไว้แล้ว โดยมีคอลัมน์ (แสดงใน console) ที่เก็บค่าประมาณ (ลงท้ายด้วย "_est") และค่า Margin of Error (ลงท้ายด้วย "_moe") สำหรับจำนวนแรงงานทั้งหมดและผู้ใช้จักรยาน

นำเข้าฟังก์ชัน sqrt จากโมดูล numpy ไว้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • คำนวณ bike_share โดยหารจำนวนผู้ใช้จักรยานด้วยจำนวนแรงงานทั้งหมด
  • คำนวณค่า SE ของค่าประมาณผู้ใช้จักรยานและแรงงานทั้งหมด โดยหารค่า MOE ด้วย Z_CRIT
  • คำนวณค่า SE ของสัดส่วน: se_bike คือค่า SE ของกลุ่มย่อย \(SE_n\), bike_share คือสัดส่วน \(P\) และ se_total คือค่า SE ของประชากรทั้งหมด \(SE_N\)
  • คำนวณ \(Z\): \(x_1\) และ \(x_2\) คือค่า bike_share ในปี 2017 และ 2011 ส่วน \(SE_{x_1}\) และ \(SE_{x_2}\) คือค่า se_p ในปี 2017 และ 2011

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Set the critical Z score for 90% confidence
Z_CRIT = 1.645

# Calculate share of bike commuting
dc["bike_share"] = ____

# Calculate standard errors of the estimate from MOEs
dc["se_bike"] = ____
dc["se_total"] = ____
dc["se_p"] = sqrt(____**2 - ____**2 * ____**2)**0.5 / dc["total_est"]

# Calculate the two sample statistic between 2011 and 2017
Z = (dc[dc["year"] == 2017]["bike_share"] - ____) / \
    sqrt(____**2 + ____**2)
print(Z_CRIT < Z)
แก้ไขและรันโค้ด