Analizar datos sesgados con una prueba de permutación
Las pruebas de permutación son útiles cuando no se cumplen las condiciones de las pruebas de hipótesis que ya conoces. En este ejercicio programarás una prueba de permutación usando el paquete statsmodels.
Quieres comparar el número medio de rondas de financiación entre las empresas del ámbito de analytics y el resto de empresas financiadas por capital riesgo. Aunque podrías pensar en usar una prueba t, puedes estar seguro de que el número de rondas de financiación NO sigue una distribución normal. De hecho, la mayoría de empresas solo tiene una ronda, y el número de empresas con dos o más rondas cae rápidamente.
Se han cargado los siguientes datos para ti:
analytics_df- Datos de todas las empresas de analyticsnon_analytics_df- Datos de todas las demás empresas que no son de analytics
Este ejercicio forma parte del curso
Fundamentos de la inferencia en Python
Instrucciones del ejercicio
- Define una función de estadístico que, dadas dos muestras
fundings_group_1yfundings_group_2, devuelva la diferencia en la media del número defunding_rounds. - Realiza una prueba de permutación usando la columna
funding_roundsde cada conjunto de datos, la función de estadístico que definiste y 100 remuestreos. - Imprime el valor p resultante de tu prueba de permutación.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Write a "statistic" function which calculates the difference in means
def statistic(funding_group_1, funding_group_2):
return ____(fundings_group_1) - ____(funding_group_2)
# Conduct a permutation test using 100 resamples
perm_result = stats.permutation_test((____['funding_rounds'], ____['funding_rounds']),
statistic=____,
n_resamples=____,
vectorized=____)
# Print the p-value
____(____.pvalue)