Istotność różnicy między udziałami
Dojeżdżanie do pracy rowerem wciąż nie jest powszechne, jednak Waszyngton ma w tej dziedzinie niezłe wyniki. W ostatnich latach udział rowerzystów wzrósł o ponad 1 punkt procentowy – ale czy ten wzrost jest statystycznie istotny? W tym ćwiczeniu obliczysz błąd standardowy udziału, a następnie dwupróbkową statystykę Z dla proporcji.
Wzór na błąd standardowy (SE) udziału:
$$SE_P = \frac{1}{N}\sqrt{SE_n^2 - P^2SE_N^2}$$
Wzór na dwupróbkową statystykę Z:
$$Z = \frac{x_1 - x_2}{\sqrt{SE_{x_1}^2 + SE_{x_2}^2}}$$
Wczytana jest ramka danych dc. Zawiera kolumny (widoczne w konsoli) z estymatorami (kończącymi się na "_est") i marginesami błędu (kończącymi się na "_moe") dla ogólnej liczby pracowników oraz dojeżdżających rowerem.
Funkcja sqrt została zaimportowana z modułu numpy.
To ćwiczenie jest częścią kursu
Analiza danych spisowych USA w Pythonie
Instrukcje do ćwiczenia
- Oblicz
bike_share, dzieląc liczbę rowerzystów przez całkowitą liczbę pracowników. - Oblicz SE estymatora liczby rowerzystów i ogółu pracowników, dzieląc MOE przez
Z_CRIT. - Oblicz SE udziałów:
se_biketo SE podpopulacji \(SE_n\),bike_shareto udział \(P\), ase_totalto SE populacji \(SE_N\). - Oblicz \(Z\): \(x_1\) i \(x_2\) to wartości
bike_shareodpowiednio w 2017 i 2011 roku; \(SE_{x_1}\) i \(SE_{x_2}\) to wartościse_pw 2017 i 2011 roku.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Set the critical Z score for 90% confidence
Z_CRIT = 1.645
# Calculate share of bike commuting
dc["bike_share"] = ____
# Calculate standard errors of the estimate from MOEs
dc["se_bike"] = ____
dc["se_total"] = ____
dc["se_p"] = sqrt(____**2 - ____**2 * ____**2)**0.5 / dc["total_est"]
# Calculate the two sample statistic between 2011 and 2017
Z = (dc[dc["year"] == 2017]["bike_share"] - ____) / \
sqrt(____**2 + ____**2)
print(Z_CRIT < Z)