Аналіз асиметричних даних за допомогою перестановкового тесту
Перестановкові тести корисні, коли не виконуються умови класичних критеріїв, які ви вже знаєте. У цій вправі ви реалізуєте перестановковий тест за допомогою пакета statsmodels.
Вас цікавить порівняння середньої кількості раундів фінансування між компаніями в аналітичній сфері та всіма іншими венчурно профінансованими компаніями. Хоч може виникнути спокуса використати t‑тест, відомо, що кількість раундів фінансування не має нормального розподілу. Натомість у більшості компаній лише один раунд, а кількість компаній із двома чи більше раундами швидко зменшується.
Для вас уже завантажено:
analytics_df— дані про всі аналітичні компаніїnon_analytics_df— дані про всі інші неаналітичні компанії
Ця вправа є частиною курсу
Основи інференції в Python
Інструкції до вправи
- Визначте функцію статистики, яка для двох вибірок
fundings_group_1таfundings_group_2повертає різницю середньої кількостіfunding_rounds. - Виконайте перестановковий тест, використовуючи стовпчик
funding_roundsз кожного набору даних, визначену вами функцію статистики та 100 повторних вибірок. - Виведіть отримане p-значення вашого перестановкового тесту.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Write a "statistic" function which calculates the difference in means
def statistic(funding_group_1, funding_group_2):
return ____(fundings_group_1) - ____(funding_group_2)
# Conduct a permutation test using 100 resamples
perm_result = stats.permutation_test((____['funding_rounds'], ____['funding_rounds']),
statistic=____,
n_resamples=____,
vectorized=____)
# Print the p-value
____(____.pvalue)