Intervalle t de confiance par bootstrap
Les exercices précédents vous ont appris deux choses :
- Vous pouvez mesurer la variabilité associée à \(\hat{p}\) en rééchantillonnant à partir de l'échantillon initial.
- Une fois que vous connaissez la variabilité de \(\hat{p}\), vous pouvez l'utiliser pour évaluer à quelle distance se trouve la véritable proportion.
Notez que le taux de proximité (ici 95 %) renvoie à la fréquence à laquelle un échantillon est choisi de façon à être proche du paramètre de la population. Vous ne saurez jamais si un jeu de données particulier est proche ou loin du paramètre, mais vous savez qu'à long terme, 95 % des échantillons que vous recueillez devraient vous donner des estimations à l'intérieur de \(2SE\) du véritable paramètre de la population.
Les votes d'un seul sondage, one_poll, et les données de 1000 rééchantillonnages bootstrap, one_poll_boot, sont disponibles dans votre espace de travail. Ils sont basés sur l'Expérience 2 présentée plus tôt dans le chapitre.
Comme dans l'exercice précédent, lorsqu'on parle de la variabilité d'une statistique, on appelle ce nombre l'erreur-type.
Cette activité fait partie du cours
Fondements de l'inférence en R
Instructions de l’exercice
- Calculez \(\hat{p}\) et assignez le résultat à
p_hat. Dans l'appel àsummarize(), calculezstatcomme la moyenne devoteégal à"yes". - Trouvez un intervalle de valeurs plausibles pour le vrai paramètre en calculant \(\hat{p} \pm 2SE\).
- La borne
lowerde l'intervalle de confiance estp_hatmoins deux fois l'erreur-type destat. Utilisezsd()pour calculer l'erreur-type. - La borne
upperestp_hatplus deux fois l'erreur-type destat.
- La borne
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# From previous exercises
one_poll <- all_polls %>%
filter(poll == 1) %>%
select(vote)
one_poll_boot <- one_poll %>%
specify(response = vote, success = "yes") %>%
generate(reps = 1000, type = "bootstrap") %>%
calculate(stat = "prop")
p_hat <- one_poll %>%
# Calculate proportion of yes votes
summarize(stat = ___) %>%
pull()
# Create an interval of plausible values
one_poll_boot %>%
summarize(
# Lower bound is p_hat minus 2 std errs
lower = ___,
# Upper bound is p_hat plus 2 std errs
upper = ___
)