НачатьНачать бесплатно

Анализ асимметричных данных с помощью перестановочного теста

Перестановочные тесты удобны в ситуациях, когда данные не удовлетворяют условиям уже знакомых вам критериев. В этом упражнении вы реализуете перестановочный тест с помощью пакета statsmodels.

Вас интересует сравнение среднего числа раундов финансирования между компаниями в сфере аналитики и всеми остальными венчурными компаниями. Несмотря на возможный соблазн применить t-тест, число раундов финансирования не подчиняется нормальному распределению: большинство компаний проходят лишь один раунд, а количество компаний с двумя и более раундами быстро убывает.

Для вас уже загружены следующие данные:

  • analytics_df — данные по всем аналитическим компаниям
  • non_analytics_df — данные по всем остальным компаниям, не относящимся к аналитике

Это упражнение является частью курса

Основы статистического вывода на Python

Посмотреть курс

Инструкции к упражнению

  • Определите функцию статистики, которая принимает две выборки — fundings_group_1 и fundings_group_2 — и возвращает разность средних значений столбца funding_rounds.
  • Проведите перестановочный тест, используя столбец funding_rounds из каждого набора данных, определённую вами функцию статистики и 100 повторных выборок.
  • Выведите на экран p-значение, полученное в результате перестановочного теста.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Write a "statistic" function which calculates the difference in means
def statistic(funding_group_1, funding_group_2):
  return ____(fundings_group_1) - ____(funding_group_2)

# Conduct a permutation test using 100 resamples
perm_result = stats.permutation_test((____['funding_rounds'], ____['funding_rounds']),
                                    statistic=____,
                                    n_resamples=____,
                                    vectorized=____)

# Print the p-value
____(____.pvalue)
Редактировать и запускать код