시작하기무료로 시작하기

돌연변이들의 그룹

그룹별 요약 통계를 계산하는 것 외에도, 그룹별 값을 사용해 열을 변환할 수 있습니다. 예를 들어 값을 정규화하는 한 가지 방법은 평균을 빼고 표준편차로 나누는 것입니다. 다음 코드를 사용하면 그룹별 정규화를 수행할 수 있습니다.

a_tibble %>%
  group_by(grp1, grp2) %>%
  mutate(normalized_x = (x - mean(x)) / sd(x))

이 연습은 강의의 일부입니다

R에서 sparklyr로 시작하는 Spark

강의 보기

연습 안내

spark_conn이라는 Spark 연결이 생성되어 있습니다. Spark에 저장된 트랙 메타데이터에 연결된 티블은 track_metadata_tbl로 미리 정의되어 있습니다.

  • track_metadata의 내용을 artist_name으로 그룹화하세요.
  • time_since_first_release라는 새 열을 추가하세요.
    • 이 열은 아티스트가 트랙을 처음 발매한 해, 즉 min() year를 기준으로, 그룹별 year에서 그 처음 해를 뺀 값이 되도록 하세요.
  • time_since_first_release를 기준으로 내림차순 정렬하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Group by artist
  ___ %>%
  # Calc time since first release
  ___ %>%
  # Arrange by descending time since first release
  ___
코드 편집 및 실행