Prozkoumání chybových rozpětí
Data z ACS se od dat ze sčítání lidu liší tím, že jde o odhady doplněné o příslušné chybové rozpětí. Chybová rozpětí v ACS standardně odpovídají 90% intervalu spolehlivosti okolo daného odhadu – to znamená, že s 90% jistotou leží skutečná hodnota v rozsahu uvedeného odhadu plus/minus uvedené chybové rozpětí.
V tomto cvičení si vyzkoušíš práci s daty, u nichž jsou chybová rozpětí vysoká vzhledem k samotným odhadům. Jako příklad použijeme chudobu obyvatel ve věku 75 let a starších podle sčítacích obvodů (Census tracts) ve státě Vermont.
Toto cvičení je součástí kurzu
Analýza dat amerického sčítání lidu v R
Pokyny k cvičení
- Načti datovou sadu o chudobě seniorů podle sčítacích obvodů ve státě Vermont z ACS.
- Vyfiltruj datový rámec tak, aby nový datový rámec obsahoval pouze řádky, kde chybové rozpětí převyšuje hodnotu odhadu.
- Vyděl počet řádků v
moe_checkpočtem řádků v původní datové sadě, abys zjistil/a, jaký podíl řádků má chybové rozpětí větší než odpovídající odhad.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Get data on elderly poverty by Census tract in Vermont
vt_eldpov <- ___(___ = "tract",
variables = c(eldpovm = "B17001_016",
eldpovf = "B17001_030"),
state = "VT")
vt_eldpov
# Identify rows with greater margins of error than their estimates
moe_check <- ___(vt_eldpov, moe > ___)
# Check proportion of rows where the margin of error exceeds the estimate
___(moe_check) / nrow(vt_eldpov)