Анализ асимметричных данных с помощью перестановочного теста
Перестановочные тесты удобны в ситуациях, когда данные не удовлетворяют условиям уже знакомых вам критериев. В этом упражнении вы реализуете перестановочный тест с помощью пакета statsmodels.
Вас интересует сравнение среднего числа раундов финансирования между компаниями в сфере аналитики и всеми остальными венчурными компаниями. Несмотря на возможный соблазн применить t-тест, число раундов финансирования не подчиняется нормальному распределению: большинство компаний проходят лишь один раунд, а количество компаний с двумя и более раундами быстро убывает.
Для вас уже загружены следующие данные:
analytics_df— данные по всем аналитическим компаниямnon_analytics_df— данные по всем остальным компаниям, не относящимся к аналитике
Это упражнение является частью курса
Основы статистического вывода на Python
Инструкции к упражнению
- Определите функцию статистики, которая принимает две выборки —
fundings_group_1иfundings_group_2— и возвращает разность средних значений столбцаfunding_rounds. - Проведите перестановочный тест, используя столбец
funding_roundsиз каждого набора данных, определённую вами функцию статистики и 100 повторных выборок. - Выведите на экран p-значение, полученное в результате перестановочного теста.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Write a "statistic" function which calculates the difference in means
def statistic(funding_group_1, funding_group_2):
return ____(fundings_group_1) - ____(funding_group_2)
# Conduct a permutation test using 100 resamples
perm_result = stats.permutation_test((____['funding_rounds'], ____['funding_rounds']),
statistic=____,
n_resamples=____,
vectorized=____)
# Print the p-value
____(____.pvalue)