Analizzare dati asimmetrici con un test di permutazione
I test di permutazione sono utili quando non sono soddisfatte le condizioni dei test d'ipotesi che già conosci. In questo esercizio programmerai un test di permutazione usando il pacchetto statsmodels.
Vuoi confrontare il numero medio di round di finanziamento tra le aziende nell'ambito analytics e tutte le altre aziende finanziate da venture capital. Anche se potresti essere tentato di usare un t-test, sappi che il numero di round di finanziamento non è distribuito in modo normale. La maggior parte delle aziende ha un solo round, e il numero di aziende con due o più round cala rapidamente.
Sono già stati caricati per te:
analytics_df- Dati su tutte le aziende di analyticsnon_analytics_df- Dati su tutte le altre aziende non-analytics
Questo esercizio fa parte del corso
Fondamenti dell'inferenza in Python
Istruzioni dell'esercizio
- Definisci una funzione statistica che, dati due campioni
fundings_group_1efundings_group_2, restituisca la differenza nella media del numero difunding_rounds. - Esegui un test di permutazione usando la colonna
funding_roundsdi ciascun insieme di dati, la funzione statistica che hai definito e 100 riacampionamenti. - Stampa il p-value risultante del tuo test di permutazione.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Write a "statistic" function which calculates the difference in means
def statistic(funding_group_1, funding_group_2):
return ____(fundings_group_1) - ____(funding_group_2)
# Conduct a permutation test using 100 resamples
perm_result = stats.permutation_test((____['funding_rounds'], ____['funding_rounds']),
statistic=____,
n_resamples=____,
vectorized=____)
# Print the p-value
____(____.pvalue)