Значимость различия долей
Поездки на велосипеде по-прежнему редкость, однако в Вашингтоне, округ Колумбия, доля велосипедистов-коммьютеров заметна. За последние несколько лет она выросла более чем на 1 процентный пункт — но является ли этот рост статистически значимым? В этом упражнении вы вычислите стандартную ошибку доли, а затем двухвыборочную Z-статистику для сравнения долей.
Формула стандартной ошибки (SE) доли:
$$SE_P = \frac{1}{N}\sqrt{SE_n^2 - P^2SE_N^2}$$
Формула двухвыборочной Z-статистики:
$$Z = \frac{x_1 - x_2}{\sqrt{SE_{x_1}^2 + SE_{x_2}^2}}$$
Датафрейм dc уже загружен. Он содержит столбцы (отображаемые в консоли) с оценками (названия оканчиваются на "_est") и погрешностями (оканчиваются на "_moe") для общего числа работников и велосипедистов-коммьютеров.
Функция sqrt импортирована из модуля numpy.
Это упражнение является частью курса
Анализ данных переписи населения США в Python
Инструкции к упражнению
- Вычислите
bike_share, разделив количество велосипедистов на общее число работников. - Вычислите стандартную ошибку оценок числа велосипедистов и общего числа работников, разделив погрешность (MOE) на
Z_CRIT. - Вычислите стандартную ошибку долей:
se_bike— это SE подвыборки \(SE_n\),bike_share— доля \(P\), аse_total— SE генеральной совокупности \(SE_N\). - Вычислите \(Z\): \(x_1\) и \(x_2\) — это значения
bike_shareв 2017 и 2011 годах; \(SE_{x_1}\) и \(SE_{x_2}\) — значенияse_pв 2017 и 2011 годах.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Set the critical Z score for 90% confidence
Z_CRIT = 1.645
# Calculate share of bike commuting
dc["bike_share"] = ____
# Calculate standard errors of the estimate from MOEs
dc["se_bike"] = ____
dc["se_total"] = ____
dc["se_p"] = sqrt(____**2 - ____**2 * ____**2)**0.5 / dc["total_est"]
# Calculate the two sample statistic between 2011 and 2017
Z = (dc[dc["year"] == 2017]["bike_share"] - ____) / \
sqrt(____**2 + ____**2)
print(Z_CRIT < Z)