Semnificația diferenței dintre proporții
Naveta cu bicicleta este încă neobișnuită, însă Washington, DC, are o pondere deloc neglijabilă. Aceasta a crescut cu peste 1 punct procentual în ultimii câțiva ani – dar este această creștere semnificativă din punct de vedere statistic? În acest exercițiu vei calcula eroarea standard a unei proporții, apoi un Z-statistic pe două eșantioane pentru proporții.
Formula pentru eroarea standard (SE) a unei proporții este:
$$SE_P = \frac{1}{N}\sqrt{SE_n^2 - P^2SE_N^2}$$
Formula pentru Z-statisticul pe două eșantioane este:
$$Z = \frac{x_1 - x_2}{\sqrt{SE_{x_1}^2 + SE_{x_2}^2}}$$
DataFrame-ul dc este încărcat. Conține coloane (vizibile în consolă) cu estimări (cu sufixul "_est") și marje de eroare (cu sufixul "_moe") pentru totalul lucrătorilor și pentru bicicliști.
Funcția sqrt a fost importată din modulul numpy.
Acest exercițiu face parte din cursul
Analiza datelor recensământului SUA în Python
Instrucțiuni pentru exercițiu
- Calculează
bike_shareîmpărțind numărul de bicicliști la numărul total de lucrători - Calculează SE-ul estimărilor pentru bicicliști și pentru totalul lucrătorilor, împărțind MOE la
Z_CRIT - Calculează SE-ul proporțiilor:
se_bikeeste SE-ul subpopulației \(SE_n\),bike_shareeste proporția \(P\), iarse_totaleste SE-ul populației \(SE_N\) - Calculează \(Z\): \(x_1\) și \(x_2\) reprezintă
bike_shareîn 2017, respectiv 2011; \(SE_{x_1}\) și \(SE_{x_2}\) reprezintăse_pîn 2017, respectiv 2011
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Set the critical Z score for 90% confidence
Z_CRIT = 1.645
# Calculate share of bike commuting
dc["bike_share"] = ____
# Calculate standard errors of the estimate from MOEs
dc["se_bike"] = ____
dc["se_total"] = ____
dc["se_p"] = sqrt(____**2 - ____**2 * ____**2)**0.5 / dc["total_est"]
# Calculate the two sample statistic between 2011 and 2017
Z = (dc[dc["year"] == 2017]["bike_share"] - ____) / \
sqrt(____**2 + ____**2)
print(Z_CRIT < Z)