Bootstrap et erreur-type
Imaginez un parc national où les gardes-parc font de la randonnée chaque jour pour entretenir les sentiers. Ils ne suivent pas toujours le même trajet, mais ils consignent leur distance finale et le temps. Nous souhaitons bâtir un modèle statistique des variations de la distance quotidienne parcourue à partir d'un échantillon limité de données provenant d'un seul garde-parc.
Votre objectif est d'utiliser le rééchantillonnage bootstrap, en calculant une moyenne pour chaque rééchantillon, afin de créer une distribution de moyennes, puis de calculer l'erreur-type pour quantifier l'« incertitude » de la statistique d'échantillon comme estimateur de la statistique de population.
Utilisez le tableau sample_data préchargé, qui contient 500 mesures indépendantes de la distance parcourue. Pour l'instant, nous utilisons un jeu de données simulé pour simplifier cette leçon. Plus tard, nous verrons des données plus réalistes.

Cette activité fait partie du cours
Introduction aux modèles linéaires en Python
Instructions de l’exercice
Attribuez
sample_datacomme modèle pour la population.Itérez
num_resamplesfois :- Utilisez
np.random.choice()chaque fois pour générer unbootstrap_sampledesize=resample_sizeà partir depopulation_modelet indiquezreplace=True. - Calculez et conservez la moyenne de l'échantillon chaque fois.
- Utilisez
Calculez et affichez
np.mean()etnp.std()debootstrap_means.Utilisez la fonction fournie
plot_data_hist()et visualisez la distribution debootstrap_means.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Use the sample_data as a model for the population
population_model = ____
# Resample the population_model 100 times, computing the mean each sample
for nr in range(num_resamples):
bootstrap_sample = np.random.____(population_model, size=____, replace=____)
bootstrap_means[nr] = np.____(bootstrap_sample)
# Compute and print the mean, stdev of the resample distribution of means
distribution_mean = np.mean(____)
standard_error = np.std(____)
print('Bootstrap Distribution: center={:0.1f}, spread={:0.1f}'.format(____, ____))
# Plot the bootstrap resample distribution of means
fig = plot_data_hist(____)