ПочатиПочніть безкоштовно

Значущість різниці часток

Поїздки на роботу велосипедом досі не дуже поширені, але у Вашингтоні, округ Колумбія, їхня частка непогана. За останні кілька років вона зросла більш ніж на 1 відсотковий пункт. Але чи є це зростання статистично значущим? У цій вправі ви обчислите стандартну похибку частки, а потім Z-статистику для двох вибірок часток.

Формула стандартної похибки (SE) частки:

$$SE_P = \frac{1}{N}\sqrt{SE_n^2 - P^2SE_N^2}$$

Формула Z-статистики для двох вибірок:

$$Z = \frac{x_1 - x_2}{\sqrt{SE_{x_1}^2 + SE_{x_2}^2}}$$

Датафрейм dc уже завантажено. Він має стовпці (показані в консолі) з оцінками (із суфіксом "_est") і межами похибки (із суфіксом "_moe") для загальної кількості працівників і велосипедистів-ком'ютерів.

Функцію sqrt імпортовано з модуля numpy.

Ця вправа є частиною курсу

Аналіз даних перепису США в Python

Переглянути курс

Інструкції до вправи

  • Обчисліть bike_share, поділивши кількість велосипедистів на загальну кількість працівників
  • Обчисліть стандартну похибку (SE) оцінки для велосипедистів і загальної кількості працівників, поділивши MOE на Z_CRIT
  • Обчисліть SE часток: se_bike — це SE субпопуляції \(SE_n\), bike_share — це частка \(P\), а se_total — це SE популяції \(SE_N\)
  • Обчисліть \(Z\): \(x_1\) та \(x_2\) — це bike_share у 2017 та 2011 роках; \(SE_{x_1}\) і \(SE_{x_2}\) — це se_p у 2017 та 2011 роках

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Set the critical Z score for 90% confidence
Z_CRIT = 1.645

# Calculate share of bike commuting
dc["bike_share"] = ____

# Calculate standard errors of the estimate from MOEs
dc["se_bike"] = ____
dc["se_total"] = ____
dc["se_p"] = sqrt(____**2 - ____**2 * ____**2)**0.5 / dc["total_est"]

# Calculate the two sample statistic between 2011 and 2017
Z = (dc[dc["year"] == 2017]["bike_share"] - ____) / \
    sqrt(____**2 + ____**2)
print(Z_CRIT < Z)
Редагувати та запускати код