EmpezarEmpieza gratis

Analizar datos sesgados con una prueba de permutación

Las pruebas de permutación son útiles cuando no se cumplen las condiciones de las pruebas de hipótesis que ya conoces. En este ejercicio programarás una prueba de permutación usando el paquete statsmodels.

Quieres comparar el número medio de rondas de financiación entre las empresas del ámbito de analytics y el resto de empresas financiadas por capital riesgo. Aunque podrías pensar en usar una prueba t, puedes estar seguro de que el número de rondas de financiación NO sigue una distribución normal. De hecho, la mayoría de empresas solo tiene una ronda, y el número de empresas con dos o más rondas cae rápidamente.

Se han cargado los siguientes datos para ti:

  • analytics_df - Datos de todas las empresas de analytics
  • non_analytics_df - Datos de todas las demás empresas que no son de analytics

Este ejercicio forma parte del curso

Fundamentos de la inferencia en Python

Ver curso

Instrucciones del ejercicio

  • Define una función de estadístico que, dadas dos muestras fundings_group_1 y fundings_group_2, devuelva la diferencia en la media del número de funding_rounds.
  • Realiza una prueba de permutación usando la columna funding_rounds de cada conjunto de datos, la función de estadístico que definiste y 100 remuestreos.
  • Imprime el valor p resultante de tu prueba de permutación.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Write a "statistic" function which calculates the difference in means
def statistic(funding_group_1, funding_group_2):
  return ____(fundings_group_1) - ____(funding_group_2)

# Conduct a permutation test using 100 resamples
perm_result = stats.permutation_test((____['funding_rounds'], ____['funding_rounds']),
                                    statistic=____,
                                    n_resamples=____,
                                    vectorized=____)

# Print the p-value
____(____.pvalue)
Editar y ejecutar código