CommencezCommencez gratuitement

Signification de la différence de proportions

Le déplacement domicile-travail à vélo reste peu courant, mais Washington, D.C., affiche une part appréciable. Celle-ci a augmenté de plus de 1 point de pourcentage au cours des dernières années, mais s'agit-il d'une hausse statistiquement significative? Dans cet exercice, vous allez calculer l'erreur-type d'une proportion, puis une statistique Z à deux échantillons pour les proportions.

La formule de l'erreur-type (ET) d'une proportion est :

$$SE_P = \frac{1}{N}\sqrt{SE_n^2 - P^2SE_N^2}$$

La formule de la statistique Z à deux échantillons est :

$$Z = \frac{x_1 - x_2}{\sqrt{SE_{x_1}^2 + SE_{x_2}^2}}$$

Le DataFrame dc est chargé. Il contient des colonnes (affichées dans la console) avec des estimations (se terminant par "_est") et des marges d'erreur (se terminant par "_moe") pour le nombre total de travailleuses et travailleurs et pour les personnes se rendant au travail à vélo.

La fonction sqrt a été importée du module numpy.

Cette activité fait partie du cours

Analyser les données du recensement des États-Unis avec Python

Voir le cours

Instructions de l’exercice

  • Calculez bike_share en divisant le nombre de cyclistes par le nombre total de personnes au travail
  • Calculez l'ET de l'estimation des cyclistes et du total des personnes au travail, en divisant la MOE par Z_CRIT
  • Calculez l'ET des proportions : se_bike est l'ET de la sous-population \(SE_n\), bike_share est la proportion \(P\), et se_total est l'ET de la population \(SE_N\)
  • Calculez \(Z\) : \(x_1\) et \(x_2\) sont les bike_share en 2017 et 2011; \(SE_{x_1}\) et \(SE_{x_2}\) sont se_p en 2017 et 2011

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Set the critical Z score for 90% confidence
Z_CRIT = 1.645

# Calculate share of bike commuting
dc["bike_share"] = ____

# Calculate standard errors of the estimate from MOEs
dc["se_bike"] = ____
dc["se_total"] = ____
dc["se_p"] = sqrt(____**2 - ____**2 * ____**2)**0.5 / dc["total_est"]

# Calculate the two sample statistic between 2011 and 2017
Z = (dc[dc["year"] == 2017]["bike_share"] - ____) / \
    sqrt(____**2 + ____**2)
print(Z_CRIT < Z)
Modifier et exécuter le code