Statistická významnost rozdílu podílů
Dojíždění na kole je stále poměrně výjimečné, ale Washington, DC, má v tomto ohledu slušný podíl. Za posledních několik let vzrostl o více než 1 procentní bod – je to ale statisticky významný nárůst? V tomto cvičení vypočítáš standardní chybu podílu a poté dvou-výběrový Z-statistik pro porovnání podílů.
Vzorec pro standardní chybu (SE) podílu je:
$$SE_P = \frac{1}{N}\sqrt{SE_n^2 - P^2SE_N^2}$$
Vzorec pro dvou-výběrový Z-statistik je:
$$Z = \frac{x_1 - x_2}{\sqrt{SE_{x_1}^2 + SE_{x_2}^2}}$$
DataFrame dc je načtený. Obsahuje sloupce (zobrazené v konzoli) s odhady (končící "_est") a hranicemi chyby (končící "_moe") pro celkový počet pracujících a dojíždějících cyklistů.
Funkce sqrt je naimportovaná z modulu numpy.
Toto cvičení je součástí kurzu
Analýza dat amerického sčítání lidu v Pythonu
Pokyny k cvičení
- Vypočítej
bike_sharejako podíl počtu cyklistů k celkovému počtu pracujících - Vypočítej SE odhadů pro cyklisty a celkový počet pracujících tak, že vydělíš MOE hodnotou
Z_CRIT - Vypočítej SE podílů:
se_bikeje SE dílčí populace \(SE_n\),bike_shareje podíl \(P\) ase_totalje SE celkové populace \(SE_N\) - Vypočítej \(Z\): \(x_1\) a \(x_2\) jsou hodnoty
bike_sharev roce 2017 a 2011; \(SE_{x_1}\) a \(SE_{x_2}\) jsou hodnotyse_pv roce 2017 a 2011
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Set the critical Z score for 90% confidence
Z_CRIT = 1.645
# Calculate share of bike commuting
dc["bike_share"] = ____
# Calculate standard errors of the estimate from MOEs
dc["se_bike"] = ____
dc["se_total"] = ____
dc["se_p"] = sqrt(____**2 - ____**2 * ____**2)**0.5 / dc["total_est"]
# Calculate the two sample statistic between 2011 and 2017
Z = (dc[dc["year"] == 2017]["bike_share"] - ____) / \
sqrt(____**2 + ____**2)
print(Z_CRIT < Z)