Проверка гипотезы о корреляции Пирсона
Наблюдаемая корреляция между женской неграмотностью и рождаемостью может оказаться случайной: рождаемость в той или иной стране может быть полностью независима от уровня неграмотности. Проверим эту гипотезу. Для этого переставим значения неграмотности, оставив значения рождаемости неизменными. Это имитирует гипотезу о полной независимости двух переменных. Для каждой перестановки вычислите коэффициент корреляции Пирсона и оцените, в какой доле реплик перестановки он превышает наблюдаемое значение.
Функция pearson_r(), которую вы написали в первой части этого курса для вычисления коэффициента корреляции Пирсона, уже доступна вам.
Это упражнение является частью курса
Статистическое мышление на Python (часть 2)
Инструкции к упражнению
- Вычислите наблюдаемую корреляцию Пирсона между
illiteracyиfertility. - Инициализируйте массив для хранения реплик перестановки.
- Напишите цикл
forдля получения 10 000 реплик:- Переставьте значения
illiteracyс помощьюnp.random.permutation(). - Вычислите корреляцию Пирсона между переставленным массивом неграмотности
illiteracy_permutedиfertility.
- Переставьте значения
- Вычислите p-значение по репликам и выведите его на экран.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Compute observed correlation: r_obs
r_obs = ____
# Initialize permutation replicates: perm_replicates
perm_replicates = np.empty(10000)
# Draw replicates
for ____ in ____:
# Permute illiteracy measurments: illiteracy_permuted
illiteracy_permuted = ____
# Compute Pearson correlation
perm_replicates[i] = ____
# Compute p-value: p
p = ____
print('p-val =', p)