Inference s odlehlou hodnotou a bez ní (randomizace)
Pomocí randomizačního testu můžeš znovu vyhodnotit vliv odlehlé hodnoty na závěry inference lineárního modelu. Spusť randomizační test na datech hypdata_out dvakrát: jednou s odlehlou hodnotou a jednou bez ní. Všimni si, že rozepsané řádky kódu přehledně popisují jednotlivé kroky randomizačních testů.
Toto cvičení je součástí kurzu
Inference for Linear Regression in R
Pokyny k cvičení
Z datových rámců hypdata_out (obsahujícího odlehlou hodnotu) a hypdata_noout (s odstraněnou odlehlou hodnotou) byly vytvořeny datové rámce perm_slope_out a perm_slope_noout, které obsahují permutované sklony pro příslušné původní datové sady. Pozorované hodnoty jsou uloženy v proměnných obs_slope_out a obs_slope_noout.
- Vypočítej p-hodnoty tak, že zjistíš podíl permutovaných sklonů (v
absolutní hodnotě), které jsou větší nebo rovny (absolutní hodnotě) pozorovaných sklonů. Stejně jako dříve použij funkcimeanna binární nerovnost pro výpočet podílu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Calculate the p-value with the outlier
perm_slope_out %>%
mutate(abs_perm_slope = ___) %>%
summarize(p_value = ___)
# Calculate the p-value without the outlier
perm_slope_noout %>%
mutate(abs_perm_slope = ___) %>%
summarize(p_value = ___)