Signifikans för skillnad mellan proportioner
Att pendla med cykel är fortfarande ovanligt, men Washington, DC, har en hyfsad andel cyklister. Andelen har ökat med över 1 procentenhet de senaste åren – men är ökningen statistiskt signifikant? I den här övningen beräknar du standardfelet för en proportion och sedan ett tvåsampels-Z-värde för proportionerna.
Formeln för standardfelet (SE) för en proportion är:
$$SE_P = \frac{1}{N}\sqrt{SE_n^2 - P^2SE_N^2}$$
Formeln för tvåsampels-Z-värdet är:
$$Z = \frac{x_1 - x_2}{\sqrt{SE_{x_1}^2 + SE_{x_2}^2}}$$
DataFrame:en dc är inläst. Den innehåller kolumner (visas i konsolen) med skattningar (slutar på "_est") och felmarginaler (slutar på "_moe") för totalt antal yrkesverksamma och cyklister.
Funktionen sqrt har importerats från modulen numpy.
Den här övningen är en del av kursen
Analys av amerikansk folkräkningsdata i Python
Övningsinstruktioner
- Beräkna
bike_sharegenom att dividera antalet cyklister med det totala antalet yrkesverksamma - Beräkna SE för skattningen av cyklister och totalt antal yrkesverksamma genom att dividera felmarginalen med
Z_CRIT - Beräkna SE för proportionerna:
se_bikeär SE för delpopulationen \(SE_n\),bike_shareär proportionen \(P\) ochse_totalär SE för populationen \(SE_N\) - Beräkna \(Z\): \(x_1\) och \(x_2\) är
bike_shareför 2017 respektive 2011; \(SE_{x_1}\) och \(SE_{x_2}\) ärse_pför 2017 respektive 2011
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Set the critical Z score for 90% confidence
Z_CRIT = 1.645
# Calculate share of bike commuting
dc["bike_share"] = ____
# Calculate standard errors of the estimate from MOEs
dc["se_bike"] = ____
dc["se_total"] = ____
dc["se_p"] = sqrt(____**2 - ____**2 * ____**2)**0.5 / dc["total_est"]
# Calculate the two sample statistic between 2011 and 2017
Z = (dc[dc["year"] == 2017]["bike_share"] - ____) / \
sqrt(____**2 + ____**2)
print(Z_CRIT < Z)