Hustota rozdělení při randomizaci
100 opakování ti pomůže pochopit, jak permutování funguje. To ale nestačí k tomu, abys viděl/a celý rozsah pravděpodobných hodnot nulových rozdílů v proporcích.
Vzpomeň si na čtyři kroky statistické inference. Jsou to právě ty kroky, které budeš používat ve všech cvičeních zaměřených na inferenci – v tomto kurzu i v dalších statistických kurzech. Názvy funkcí ti pomohou si celý postup vybavit.
specifyurčí proměnné odpovědi a vysvětlující proměnné.hypothesizestanoví nulovou hypotézu.generatevygeneruje převzorkování, permutace nebo simulace.calculatevypočítá souhrnné statistiky.
V tomto cvičení celý postup zopakuješ 1000krát, abys získal/a představu o úplném rozdělení nulových rozdílů v proporcích.
Toto cvičení je součástí kurzu
Základy statistické inference v R
Pokyny k cvičení
Balíčky dplyr, ggplot2, NHANES a infer jsou již načteny.
- Vygeneruj 1000 rozdílů v proporcích tak, že zamícháš proměnnou
HomeOwnpomocí syntaxeinfer. Připomeň si postup:specify– urči, že vztah zájmu jeHomeOwnvs.Gender, přičemž úspěchem je v tomto kontextu vlastnictví bydlení:success = "Own".hypothesize– nastav platnost nulové hypotézy:null = "independence"(tj. pohlaví a vlastnictví bydlení spolu nesouvisejí).generate– vygeneruj 1000 permutací; nastavrepsna 1000.calculate– vypočítej statistikustat = "diff in props"s pořadímc("male", "female").
- Spusť kód pro vykreslení grafu hustoty, který vytvoří vyhlazené grafické zobrazení rozdělení rozdílů. Jaký tvar má tato křivka?
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Perform 1000 permutations
homeown_perm <- homes %>%
# Specify HomeOwn vs. Gender, with `"Own" as success
___(___ ~ ___, success = "___") %>%
# Use a null hypothesis of independence
___(___) %>%
# Generate 1000 repetitions (by permutation)
___(reps = ___, type = "permute") %>%
# Calculate the difference in proportions (male then female)
___(___, order = ___))
# Density plot of 1000 permuted differences in proportions
ggplot(homeown_perm, aes(x = stat)) +
geom_density()