Test de ipoteză pe corelația Pearson
Corelația observată dintre rata de analfabetism în rândul femeilor și fertilitate ar putea fi pur și simplu întâmplătoare; fertilitatea unei țări ar putea fi, de fapt, complet independentă de rata de analfabetism. Vei testa această ipoteză. Pentru aceasta, permută valorile illiteracy, lăsând valorile fertility fixe. Astfel simulezi ipoteza că cele două variabile sunt complet independente una de cealaltă. Pentru fiecare permutare, calculează coeficientul de corelație Pearson și evaluează câte dintre replicile de permutare au un coeficient de corelație Pearson mai mare decât cel observat.
Funcția pearson_r() pe care ai scris-o în cursul anterior pentru calculul coeficientului de corelație Pearson este deja disponibilă.
Acest exercițiu face parte din cursul
Gândire statistică în Python (Partea 2)
Instrucțiuni pentru exercițiu
- Calculează corelația Pearson observată dintre
illiteracyșifertility. - Inițializează un array în care să stochezi replicile de permutare.
- Scrie o buclă
forpentru a genera 10.000 de replici:- Permută valorile
illiteracyfolosindnp.random.permutation(). - Calculează corelația Pearson dintre array-ul permutate
illiteracy_permutedșifertility.
- Permută valorile
- Calculează și afișează valoarea p obținută din replici.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Compute observed correlation: r_obs
r_obs = ____
# Initialize permutation replicates: perm_replicates
perm_replicates = np.empty(10000)
# Draw replicates
for ____ in ____:
# Permute illiteracy measurments: illiteracy_permuted
illiteracy_permuted = ____
# Compute Pearson correlation
perm_replicates[i] = ____
# Compute p-value: p
p = ____
print('p-val =', p)