Ponowne próbkowanie danych NHANES
Dane NHANES są zbierane na podstawie próby jednostek (osób) wybranych w taki sposób, aby reprezentowały populację Stanów Zjednoczonych. Teraz ponownie pobierzemy próbki ze zbioru nhanes_final na różne sposoby, żeby poznać różne metody próbkowania.
Prostą próbę losową możemy przeprowadzić za pomocą slice_sample() z pakietu dplyr. Funkcja przyjmuje jako argumenty zbiór danych oraz liczbę całkowitą określającą liczbę wierszy do wylosowania.
Próbkowanie warstwowe wykonuje się, łącząc group_by() z slice_sample(). Funkcja pobierze n obserwacji z każdej grupy wskazanej w group_by().
Funkcja cluster() z pakietu sampling tworzy próby skupiskowe. Przyjmuje nazwę zbioru danych, zmienną pełniącą rolę zmiennej skupiskowej (podaną jako wektor z nazwą w postaci ciągu znaków, np. c("variable")), liczbę skupisk do wybrania oraz metodę próbkowania.
To ćwiczenie jest częścią kursu
Projektowanie eksperymentów w R
Instrukcje do ćwiczenia
- Użyj
slice_sample(), aby wybrać 2500 obserwacji znhanes_final, i zapisz wynik jakonhanes_srs. - Utwórz
nhanes_stratified, używającgroup_by()islice_sample(). Podziel dane warstwowo wedługriagendri wybierz 2000 obserwacji dla każdej płci. Sprawdź, czy operacja się powiodła, używająccount()do zbadania zmiennej płci wnhanes_stratified. - Wczytaj pakiet
sampling. Użyjcluster(), aby podzielićnhanes_finalwedług"indhhin2"na 6 skupisk metodą"srswor". Wynik przypisz donhanes_cluster.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Use slice_sample() to create nhanes_srs
nhanes_srs <- ___ %>% ___(n=___)
# Create nhanes_stratified with group_by() and slice_sample()
___ <- ___ %>% group_by(___) %>% ___(n=___)
nhanes_stratified %>% ___
# Load sampling package and create nhanes_cluster with cluster()
___
nhanes_cluster <- cluster(___, "___", 6, method = "srswor")