부분 중복 집계하기
부분 중복을 처리하는 또 다른 방법은, 부분 중복 간에 서로 다른 값들에 대해 평균, 중앙값, 최댓값, 최솟값 같은 요약 통계를 계산하는 거예요. 데이터가 어떻게 수집되었는지 확실하지 않아 평균값이 필요할 때나, 도메인 지식에 따라 과소 추정보다 과대 추정이 낫다(혹은 그 반대)고 판단될 때 유용해요.
dplyr는 로드되어 있고 bike_share_rides를 사용할 수 있어요.
이 연습은 강의의 일부입니다
R로 데이터 정리하기
연습 안내
bike_share_rides를ride_id와date로 그룹화하세요.- 각 행의
ride_id와date에 대한 평균 주행 시간(mean)을 담은duration_min_avg라는 열을 추가하세요. ride_id와date를 기준으로 중복을 제거하되, 데이터 프레임의 모든 열을 유지하세요.duration_min열을 제거하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)