Mức ý nghĩa của chênh lệch tỷ lệ
Đi làm bằng xe đạp vẫn chưa phổ biến, nhưng Washington, DC có một tỷ lệ khá ổn. Tỷ lệ này đã tăng hơn 1 điểm phần trăm trong vài năm qua, nhưng liệu đây có phải là mức tăng có ý nghĩa thống kê không? Trong bài tập này, bạn sẽ tính sai số chuẩn của một tỷ lệ, sau đó tính Z-statistic hai mẫu cho các tỷ lệ.
Công thức sai số chuẩn (SE) của một tỷ lệ là:
$$SE_P = \frac{1}{N}\sqrt{SE_n^2 - P^2SE_N^2}$$
Công thức Z-statistic hai mẫu là:
$$Z = \frac{x_1 - x_2}{\sqrt{SE_{x_1}^2 + SE_{x_2}^2}}$$
DataFrame dc đã được nạp. Nó có các cột (hiển thị trong bảng điều khiển) với ước lượng (kết thúc bằng "_est") và khoảng sai số (kết thúc bằng "_moe") cho tổng số người lao động và số người đi làm bằng xe đạp.
Hàm sqrt đã được nhập từ mô-đun numpy.
Bài tập này là một phần của khóa học
Phân tích dữ liệu Điều tra Dân số Hoa Kỳ bằng Python
Hướng dẫn bài tập
- Tính
bike_sharebằng cách chia số người đi xe đạp cho tổng số người lao động - Tính SE của ước lượng số người đi xe đạp và tổng số người lao động bằng cách chia MOE cho
Z_CRIT - Tính SE của các tỷ lệ:
se_bikelà SE của phân nhóm \(SE_n\),bike_sharelà tỷ lệ \(P\), vàse_totallà SE của tổng thể \(SE_N\) - Tính \(Z\): \(x_1\) và \(x_2\) là
bike_sharecủa năm 2017 và 2011; \(SE_{x_1}\) và \(SE_{x_2}\) làse_pcủa năm 2017 và 2011
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Set the critical Z score for 90% confidence
Z_CRIT = 1.645
# Calculate share of bike commuting
dc["bike_share"] = ____
# Calculate standard errors of the estimate from MOEs
dc["se_bike"] = ____
dc["se_total"] = ____
dc["se_p"] = sqrt(____**2 - ____**2 * ____**2)**0.5 / dc["total_est"]
# Calculate the two sample statistic between 2011 and 2017
Z = (dc[dc["year"] == 2017]["bike_share"] - ____) / \
sqrt(____**2 + ____**2)
print(Z_CRIT < Z)