Hledání největší skupiny podle okresu
Nástroje pro práci s daty z balíčků jako dplyr a purrr jsou při průzkumu dat ze sčítání lidu nesmírně výkonné. Balíček tidycensus je navržen přímo s ohledem na průzkum dat v prostředí tidyverse. Můžeš například zjistit, která rasová či etnická skupina je v každém okrese daného státu nejpočetnější. K tomu využiješ možnosti seskupování v dplyr, díky kterým snadno identifikuješ největší odhad skupiny z ACS a odfiltrování řádků odpovídajících té skupině.
Toto cvičení je součástí kurzu
Analýza dat amerického sčítání lidu v R
Pokyny k cvičení
- Seskup dataset
ca_racepodle sloupceGEOID. - Filtruj dataset tak, aby zůstaly pouze řádky, kde hodnota
estimateodpovídá maximu v dané skupině (okresu). - Pomocí funkce
tally()zjisti rozložení největších rasových a etnických skupin v okresech Kalifornie.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Group the dataset and filter the estimate
ca_largest <- ___ %>%
group_by(___) %>%
filter(___ == max(estimate))
head(ca_largest)
# Group the dataset and get a breakdown of the results
ca_largest %>%
___(___) %>%
___()