НачатьНачать бесплатно

Проверка гипотезы о корреляции Пирсона

Наблюдаемая корреляция между женской неграмотностью и рождаемостью может оказаться случайной: рождаемость в той или иной стране может быть полностью независима от уровня неграмотности. Проверим эту гипотезу. Для этого переставим значения неграмотности, оставив значения рождаемости неизменными. Это имитирует гипотезу о полной независимости двух переменных. Для каждой перестановки вычислите коэффициент корреляции Пирсона и оцените, в какой доле реплик перестановки он превышает наблюдаемое значение.

Функция pearson_r(), которую вы написали в первой части этого курса для вычисления коэффициента корреляции Пирсона, уже доступна вам.

Это упражнение является частью курса

Статистическое мышление на Python (часть 2)

Посмотреть курс

Инструкции к упражнению

  • Вычислите наблюдаемую корреляцию Пирсона между illiteracy и fertility.
  • Инициализируйте массив для хранения реплик перестановки.
  • Напишите цикл for для получения 10 000 реплик:
    • Переставьте значения illiteracy с помощью np.random.permutation().
    • Вычислите корреляцию Пирсона между переставленным массивом неграмотности illiteracy_permuted и fertility.
  • Вычислите p-значение по репликам и выведите его на экран.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Compute observed correlation: r_obs
r_obs = ____

# Initialize permutation replicates: perm_replicates
perm_replicates = np.empty(10000)

# Draw replicates
for ____ in ____:
    # Permute illiteracy measurments: illiteracy_permuted
    illiteracy_permuted = ____

    # Compute Pearson correlation
    perm_replicates[i] = ____

# Compute p-value: p
p = ____
print('p-val =', p)
Редактировать и запускать код