Analýza zešikmených dat pomocí permutačního testu
Permutační testy se hodí ve situacích, které nesplňují předpoklady hypotézových testů, které už znáš. V tomto cvičení si napíšeš permutační test pomocí balíčku statsmodels.
Zajímá tě, jestli se průměrný počet kol financování liší mezi firmami z oblasti analytiky a ostatními venture-finančně podpořenými společnostmi. Přestože by tě mohl napadnout t-test, počet kol financování rozhodně není normálně rozložen. Většina firem má jen jedno kolo a počet firem se dvěma a více koly rychle klesá.
Máš k dispozici:
analytics_df– data o všech analytických firmáchnon_analytics_df– data o všech ostatních firmách mimo analytiku
Toto cvičení je součástí kurzu
Základy statistické inference v Pythonu
Pokyny k cvičení
- Definuj funkci statistiky, která pro dva vzorky
fundings_group_1afundings_group_2vrátí rozdíl průměrného počtufunding_rounds. - Proveď permutační test pomocí sloupce
funding_roundsz každého datasetu, funkce statistiky, kterou jsi definoval/a, a 100 převzorkování. - Vypiš výslednou p-hodnotu svého permutačního testu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Write a "statistic" function which calculates the difference in means
def statistic(funding_group_1, funding_group_2):
return ____(fundings_group_1) - ____(funding_group_2)
# Conduct a permutation test using 100 resamples
perm_result = stats.permutation_test((____['funding_rounds'], ____['funding_rounds']),
statistic=____,
n_resamples=____,
vectorized=____)
# Print the p-value
____(____.pvalue)