CommencezCommencez gratuitement

Statistiques de test et taille d'effet

Comment explorer les relations linéaires avec le rééchantillonnage bootstrap? Retour sur le sentier! Pour chaque randonnée tracée comme un point, on voit une relation linéaire entre la distance totale parcourue et le temps écoulé. Si l'on traite la distance parcourue comme un « effet » du temps écoulé, on peut alors explorer le lien entre la régression linéaire et l'inférence statistique.

Dans cet exercice, vous séparerez les données en deux populations, ou « catégories » : temps précoces et temps tardifs. Ensuite, vous examinerez les différences entre les distances totales parcourues dans chaque population. Cette différence servira de « statistique de test », et sa distribution permettra d'évaluer l'effet de la séparation des distances selon le temps.

ch04_ex11_fig03.png

Cette activité fait partie du cours

Introduction aux modèles linéaires en Python

Voir le cours

Instructions de l’exercice

  • Utilisez l'« indexation logique » de numpy, p. ex. sample_distances[sample_times < 5], pour séparer l'échantillon distances en populations de temps précoces et tardifs.
  • Utilisez np.random.choice() avec replacement=True pour créer un resample pour chacun des deux regroupements de temps.
  • Calculez le tableau test_statistic comme resample_long - resample_short, puis trouvez et affichez la taille d'effet et l'incertitude avec np.mean(), np.std().
  • Tracez la distribution de test_statistic en utilisant l'objet prédéfini fig = plot_test_statistic().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create two poulations, sample_distances for early and late sample_times.
# Then resample with replacement, taking 500 random draws from each population.
group_duration_short = sample_distances[____ < 5]
group_duration_long = sample_distances[____ > 5]
resample_short = np.random.choice(____, size=500, replace=____)
resample_long = np.random.choice(____, size=500, replace=____)

# Difference the resamples to compute a test statistic distribution, then compute its mean and stdev
test_statistic = resample_long - resample_short
effect_size = np.mean(____)
standard_error = np.std(____)

# Print and plot the results
print('Test Statistic: mean={:0.2f}, stdev={:0.2f}'.format(____, ____))
fig = plot_test_statistic(____)
Modifier et exécuter le code