Significatività della differenza tra proporzioni
Andare al lavoro in bici è ancora poco comune, ma Washington, DC, ha una quota discreta. È aumentata di oltre 1 punto percentuale negli ultimi anni, ma si tratta di un aumento statisticamente significativo? In questo esercizio calcolerai l'errore standard di una proporzione e poi una statistica Z a due campioni delle proporzioni.
La formula dell'errore standard (SE) di una proporzione è:
$$SE_P = \frac{1}{N}\sqrt{SE_n^2 - P^2SE_N^2}$$
La formula della statistica Z a due campioni è:
$$Z = \frac{x_1 - x_2}{\sqrt{SE_{x_1}^2 + SE_{x_2}^2}}$$
Il DataFrame dc è già caricato. Contiene colonne (visibili nella console) con stime (che terminano con "_est") e margini di errore (che terminano con "_moe") per i lavoratori totali e per chi va al lavoro in bici.
La funzione sqrt è stata importata dal modulo numpy.
Questo esercizio fa parte del corso
Analizzare i dati del Censimento USA con Python
Istruzioni dell'esercizio
- Calcola
bike_sharedividendo il numero di ciclisti per il numero totale di lavoratori - Calcola l'SE della stima dei ciclisti e dei lavoratori totali dividendo il MOE per
Z_CRIT - Calcola l'SE delle proporzioni:
se_bikeè l'SE della sottopopolazione \(SE_n\),bike_shareè la proporzione \(P\) ese_totalè l'SE della popolazione \(SE_N\) - Calcola \(Z\): \(x_1\) e \(x_2\) sono
bike_sharenel 2017 e nel 2011; \(SE_{x_1}\) e \(SE_{x_2}\) sonose_pnel 2017 e nel 2011
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Set the critical Z score for 90% confidence
Z_CRIT = 1.645
# Calculate share of bike commuting
dc["bike_share"] = ____
# Calculate standard errors of the estimate from MOEs
dc["se_bike"] = ____
dc["se_total"] = ____
dc["se_p"] = sqrt(____**2 - ____**2 * ____**2)**0.5 / dc["total_est"]
# Calculate the two sample statistic between 2011 and 2017
Z = (dc[dc["year"] == 2017]["bike_share"] - ____) / \
sqrt(____**2 + ____**2)
print(Z_CRIT < Z)