Повторна вибірка з вибірки
Щоб дослідити, наскільки оцінки частки в генеральній сукупності змінюються від вибірки до вибірки, ви налаштуєте два експерименти зі вибіркуванням.
У першому експерименті ви змоделюєте багаторазові вибірки з генеральної сукупності. У другому ви оберете одну вибірку з першого експерименту та багаторазово робитимете повторні вибірки з цієї вибірки — метод, який називається bootstrapping (бутстрепінг). Детальніше:
Експеримент 1: Припустімо, що істинна частка людей, які голосуватимуть за Кандидата X, дорівнює 0,6. Багаторазово відбирайте по 30 людей із сукупності та оцініть мінливість \(\hat{p}\) (частки у вибірці).
Експеримент 2: Візьміть одну вибірку розміру 30 з тієї ж сукупності. Багаторазово відбирайте по 30 людей (з поверненням!) з початкової вибірки та оцініть мінливість \(\hat{p}^*\) (частки у повторній вибірці).
Важливо розуміти, що перший експеримент спирається на знання всієї сукупності й зазвичай є неможливим на практиці. Другий використовує лише вибіркові дані, тож його легко реалізувати для будь-якої статистики. На щастя, як ви побачите, мінливість \(\hat{p}\), тобто частки «успіхів» у вибірці, приблизно однакова незалежно від того, чи ми вибірковуємо з сукупності, чи повторно вибірковуємо з вибірки.
Ми створили 1000 випадкових вибірок, кожна розміром 30, із сукупності. Отриманий датафрейм all_polls доступний у вашому робочому середовищі. Ознайомтеся з ним перед початком.
Ця вправа є частиною курсу
Основи інференції в R
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Compute p-hat for each poll
ex1_props <- all_polls %>%
# Group by poll
___(___) %>%
# Calculate proportion of yes votes
___(stat = ___(___))
# Review the result
ex1_props