Analisando dados enviesados com um teste de permutação
Testes de permutação podem ser úteis em situações que não satisfazem as condições dos testes de hipótese que você já conhece. Neste exercício, você vai programar um teste de permutação usando o pacote statsmodels.
Você está interessado em comparar o número médio de rodadas de financiamento entre empresas de analytics e todas as outras empresas financiadas por capital de risco. Embora você possa ficar tentado a usar um teste t, é certo que o número de rodadas de financiamento não segue uma distribuição normal. Em vez disso, a maioria das empresas tem apenas uma rodada, e o número de empresas com duas ou mais rodadas cai rapidamente.
Os seguintes objetos já foram carregados para você:
analytics_df- Dados de todas as empresas de analyticsnon_analytics_df- Dados de todas as outras empresas que não são de analytics
Este exercicio faz parte do curso
Fundamentos de Inferência em Python
Instruções do exercicio
- Defina uma função de estatística que, dadas duas amostras
fundings_group_1efundings_group_2, retorne a diferença na média defunding_rounds. - Faça um teste de permutação usando a coluna
funding_roundsde cada conjunto de dados, a função de estatística que você definiu e 100 reamostragens. - Imprima o valor de p resultante do seu teste de permutação.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Write a "statistic" function which calculates the difference in means
def statistic(funding_group_1, funding_group_2):
return ____(fundings_group_1) - ____(funding_group_2)
# Conduct a permutation test using 100 resamples
perm_result = stats.permutation_test((____['funding_rounds'], ____['funding_rounds']),
statistic=____,
n_resamples=____,
vectorized=____)
# Print the p-value
____(____.pvalue)