Значущість різниці часток
Поїздки на роботу велосипедом досі не дуже поширені, але у Вашингтоні, округ Колумбія, їхня частка непогана. За останні кілька років вона зросла більш ніж на 1 відсотковий пункт. Але чи є це зростання статистично значущим? У цій вправі ви обчислите стандартну похибку частки, а потім Z-статистику для двох вибірок часток.
Формула стандартної похибки (SE) частки:
$$SE_P = \frac{1}{N}\sqrt{SE_n^2 - P^2SE_N^2}$$
Формула Z-статистики для двох вибірок:
$$Z = \frac{x_1 - x_2}{\sqrt{SE_{x_1}^2 + SE_{x_2}^2}}$$
Датафрейм dc уже завантажено. Він має стовпці (показані в консолі) з оцінками (із суфіксом "_est") і межами похибки (із суфіксом "_moe") для загальної кількості працівників і велосипедистів-ком'ютерів.
Функцію sqrt імпортовано з модуля numpy.
Ця вправа є частиною курсу
Аналіз даних перепису США в Python
Інструкції до вправи
- Обчисліть
bike_share, поділивши кількість велосипедистів на загальну кількість працівників - Обчисліть стандартну похибку (SE) оцінки для велосипедистів і загальної кількості працівників, поділивши MOE на
Z_CRIT - Обчисліть SE часток:
se_bike— це SE субпопуляції \(SE_n\),bike_share— це частка \(P\), аse_total— це SE популяції \(SE_N\) - Обчисліть \(Z\): \(x_1\) та \(x_2\) — це
bike_shareу 2017 та 2011 роках; \(SE_{x_1}\) і \(SE_{x_2}\) — цеse_pу 2017 та 2011 роках
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Set the critical Z score for 90% confidence
Z_CRIT = 1.645
# Calculate share of bike commuting
dc["bike_share"] = ____
# Calculate standard errors of the estimate from MOEs
dc["se_bike"] = ____
dc["se_total"] = ____
dc["se_p"] = sqrt(____**2 - ____**2 * ____**2)**0.5 / dc["total_est"]
# Calculate the two sample statistic between 2011 and 2017
Z = (dc[dc["year"] == 2017]["bike_share"] - ____) / \
sqrt(____**2 + ____**2)
print(Z_CRIT < Z)