Перевірка гіпотези для кореляції Пірсона
Спостережувана кореляція між жіночою неписьменністю та народжуваністю може бути випадковою; для певної країни народжуваність може бути цілком незалежною від рівня неписьменності. Ви перевірите цю гіпотезу. Для цього переставте значення неписьменності, а значення народжуваності залиште фіксованими. Це моделює гіпотезу про повну незалежність цих змінних. Для кожної перестановки обчисліть коефіцієнт кореляції Пірсона та визначте, у скількох із ваших перестановкових реплік коефіцієнт кореляції Пірсона більший за спостережуваний.
Функція pearson_r(), яку ви написали в першій частині цього курсу для обчислення коефіцієнта кореляції Пірсона, уже доступна для вас.
Ця вправа є частиною курсу
Статистичне мислення в Python (Частина 2)
Інструкції до вправи
- Обчисліть спостережуваний коефіцієнт кореляції Пірсона між
illiteracyтаfertility. - Ініціалізуйте масив для збереження ваших перестановкових реплік.
- Напишіть цикл
for, щоб отримати 10 000 реплік:- Переставте вимірювання
illiteracyза допомогоюnp.random.permutation(). - Обчисліть кореляцію Пірсона між переставленим масивом неписьменності
illiteracy_permutedтаfertility.
- Переставте вимірювання
- Обчисліть і виведіть p-value на основі реплік.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Compute observed correlation: r_obs
r_obs = ____
# Initialize permutation replicates: perm_replicates
perm_replicates = np.empty(10000)
# Draw replicates
for ____ in ____:
# Permute illiteracy measurments: illiteracy_permuted
illiteracy_permuted = ____
# Compute Pearson correlation
perm_replicates[i] = ____
# Compute p-value: p
p = ____
print('p-val =', p)