열 요약하기
이전 연습 문제에서 보셨던 mutate() 함수는 열을 입력으로 받아 열을 반환합니다. 평균, 최댓값, 표준편차처럼 요약 통계를 계산할 때는 보통 열들을 입력으로 받아 단일 값을 반환하길 원하죠. 이는 summarize() 함수로 할 수 있습니다.
a_tibble %>%
summarize(
mean_x = mean(x),
sd_x_times_y = sd(x * y)
)
dplyr는(그리고 이를 따르는 sparklyr도) 데이터를 항상 tibble 형태로 유지하는 철학을 가지고 있습니다. 따라서 여기의 반환 값은 한 행짜리 tibble이며, 계산된 각 요약 통계마다 하나의 열이 생성됩니다.
이 연습은 강의의 일부입니다
R에서 sparklyr로 시작하는 Spark
연습 안내
spark_conn라는 Spark 연결이 이미 생성되어 있습니다. Spark에 저장된 트랙 메타데이터에 연결된 tibble은 track_metadata_tbl로 미리 정의되어 있습니다.
title과duration필드를 선택하세요.- 결과를 파이프로 넘겨 트랙 길이를 분 단위로 담는 새 필드
duration_minutes를 만드세요. - 결과를 다시
summarize()로 파이프하여, 분 단위 평균 길이를mean_duration_minutes라는 필드에 계산하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___ %>%
# Summarize columns
___