Začněte nyníZačněte zdarma

Analýza zešikmených dat pomocí permutačního testu

Permutační testy se hodí ve situacích, které nesplňují předpoklady hypotézových testů, které už znáš. V tomto cvičení si napíšeš permutační test pomocí balíčku statsmodels.

Zajímá tě, jestli se průměrný počet kol financování liší mezi firmami z oblasti analytiky a ostatními venture-finančně podpořenými společnostmi. Přestože by tě mohl napadnout t-test, počet kol financování rozhodně není normálně rozložen. Většina firem má jen jedno kolo a počet firem se dvěma a více koly rychle klesá.

Máš k dispozici:

  • analytics_df – data o všech analytických firmách
  • non_analytics_df – data o všech ostatních firmách mimo analytiku

Toto cvičení je součástí kurzu

Základy statistické inference v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Definuj funkci statistiky, která pro dva vzorky fundings_group_1 a fundings_group_2 vrátí rozdíl průměrného počtu funding_rounds.
  • Proveď permutační test pomocí sloupce funding_rounds z každého datasetu, funkce statistiky, kterou jsi definoval/a, a 100 převzorkování.
  • Vypiš výslednou p-hodnotu svého permutačního testu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Write a "statistic" function which calculates the difference in means
def statistic(funding_group_1, funding_group_2):
  return ____(fundings_group_1) - ____(funding_group_2)

# Conduct a permutation test using 100 resamples
perm_result = stats.permutation_test((____['funding_rounds'], ____['funding_rounds']),
                                    statistic=____,
                                    n_resamples=____,
                                    vectorized=____)

# Print the p-value
____(____.pvalue)
Upravit a spustit kód