Емпіричне правило
Багато статистик, які ми використовуємо в аналізі даних (зокрема вибіркове середнє та вибіркова частка), мають корисні властивості, що допомагають краще зрозуміти параметр(и) генеральної сукупності, які нас цікавлять.
Одна з таких властивостей: якщо відома мінливість вибіркової частки (її називають стандартною похибкою, або \(SE\)), то приблизно 95% значень \(\hat{p}\) (із різних вибірок) лежатимуть у межах \(2SE\) від істинної частки в генеральній сукупності.
Щоб перевірити, чи виконується це у нашій ситуації, повернімося до опитувань, згенерованих шляхом отримання багатьох вибірок з тієї самої сукупності.
Набір даних all_polls містить 1000 вибірок розміру 30 з сукупності, у якій імовірність голосу за Кандидата X дорівнює 0,6.
Зверніть увагу: ви використаєте функцію R sd(), яка обчислює мінливість будь-якого набору чисел. У статистиці, коли sd() застосовано до змінної (наприклад, ціни будинку), ми називаємо це стандартним відхиленням. Коли sd() застосовано до статистики (наприклад, набору вибіркових часток), ми називаємо це стандартною похибкою.
Ця вправа є частиною курсу
Основи інференції в R
Інструкції до вправи
- Запустіть код, щоб згенерувати
props— частку осіб, які планують відповісти «так» у кожному опитуванні. Це базується наex1_propsіз попередніх вправ. - Додайте стовпець
is_in_conf_int, який дорівнюєTRUE, якщо вибіркова частка голосів «так» відрізняється від істинної частки «так» у сукупності менш ніж на2стандартні похибки. Тобтоabs()-солютна різниця міжprop_yesіtrue_prop_yesє меншою за подвійнуsd()відprop_yes. - Обчисліть частку вибіркових статистик у довірчому інтервалі,
prop_in_conf_int, узявшиmean()відis_in_conf_int.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Proportion of yes votes by poll
props <- all_polls %>%
group_by(poll) %>%
summarize(prop_yes = mean(vote == "yes"))
# The true population proportion of yes votes
true_prop_yes <- 0.6
# Proportion of polls within 2SE
props %>%
# Add column: is prop_yes in 2SE of 0.6
mutate(is_in_conf_int = ___(___ - ___) < ___ * ___(___)) %>%
# Calculate proportion in conf int
summarize(prop_in_conf_int = ___(___))