ПочатиПочніть безкоштовно

Аналіз асиметричних даних за допомогою перестановкового тесту

Перестановкові тести корисні, коли не виконуються умови класичних критеріїв, які ви вже знаєте. У цій вправі ви реалізуєте перестановковий тест за допомогою пакета statsmodels.

Вас цікавить порівняння середньої кількості раундів фінансування між компаніями в аналітичній сфері та всіма іншими венчурно профінансованими компаніями. Хоч може виникнути спокуса використати t‑тест, відомо, що кількість раундів фінансування не має нормального розподілу. Натомість у більшості компаній лише один раунд, а кількість компаній із двома чи більше раундами швидко зменшується.

Для вас уже завантажено:

  • analytics_df — дані про всі аналітичні компанії
  • non_analytics_df — дані про всі інші неаналітичні компанії

Ця вправа є частиною курсу

Основи інференції в Python

Переглянути курс

Інструкції до вправи

  • Визначте функцію статистики, яка для двох вибірок fundings_group_1 та fundings_group_2 повертає різницю середньої кількості funding_rounds.
  • Виконайте перестановковий тест, використовуючи стовпчик funding_rounds з кожного набору даних, визначену вами функцію статистики та 100 повторних вибірок.
  • Виведіть отримане p-значення вашого перестановкового тесту.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Write a "statistic" function which calculates the difference in means
def statistic(funding_group_1, funding_group_2):
  return ____(fundings_group_1) - ____(funding_group_2)

# Conduct a permutation test using 100 resamples
perm_result = stats.permutation_test((____['funding_rounds'], ____['funding_rounds']),
                                    statistic=____,
                                    n_resamples=____,
                                    vectorized=____)

# Print the p-value
____(____.pvalue)
Редагувати та запускати код