시작하기무료로 시작하기

변수 다시 코딩하기와 그룹 합계 계산

tidyverse의 핵심 패키지 중 하나인 dplyr에는 데이터 정리를 위한 다양한 함수가 포함되어 있어요. 이 기능을 통해 데이터셋의 값을 다시 코딩하고, 데이터셋 내 그룹을 정의하며, 각 그룹에 대해 계산을 수행할 수 있습니다. 이러한 작업은 보통 %>% 연산자로 표시되는 파이프 안에서 이루어집니다.

이 연습 문제에서는 tidyverse 워크플로 안에서 ACS 데이터를 다뤄 보겠습니다. ACS 표 B19001에서 가구 중위소득 변수가 $35,000 미만, $35,000 이상 $75,000 이하, $75,000 초과인 경우를 구분해 보세요. 그런 다음 워싱턴주의 카운티별로 각 그룹에 속하는 가구 수를 집계합니다.

이 연습은 강의의 일부입니다

R로 분석하는 미국 인구조사 데이터

강의 보기

연습 안내

  • 변수 값이 "B19001_001"와 같은 행은 전체 가구 수를 나타내므로 제외하세요.
  • case_when() 함수를 사용해 다시 코딩한 그룹을 정의할 incgroup 열을 생성하세요.
  • group_by() 함수를 사용해 데이터셋을 카운티 이름과 소득 그룹별로 그룹화하세요.
  • 마지막으로 summarize() 함수를 사용해 카운티별 그룹 합계를 집계하고, 결과를 확인하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
  ___(___ != "B19001_001") %>%
  mutate(incgroup = ___(
    variable < "B19001_008" ~ "below35k", 
    variable < "B19001_013" ~ "35kto75k", 
    TRUE ~ "above75k"
  )) %>%
  ___(NAME, incgroup) %>%
  ___(group_est = sum(estimate))

wa_grouped
코드 편집 및 실행