고유 행 선택하기
요인(factor)에 범주형 변수가 저장되어 있다면, 개별 범주가 무엇인지 아는 것이 유용합니다. 이를 위해 levels() 함수를 사용해요. 티블(tibble)에서는 좀 더 일반적으로, 고유한 데이터가 있는 행을 찾는 개념이 있습니다. SQL 용어를 따르면, 이는 distinct() 함수를 사용해 수행합니다. 이 함수는 데이터셋에 직접 적용할 수 있으며, 특정 열 집합의 고유한 조합을 찾습니다. 예를 들어, x, y, z 열의 값 조합 중 고유한 것들을 찾으려면 다음과 같이 작성합니다.
a_tibble %>%
distinct(x, y, z)
이 연습은 강의의 일부입니다
R에서 sparklyr로 시작하는 Spark
연습 안내
이미 spark_conn이라는 이름의 Spark 연결이 생성되어 있습니다. Spark에 저장된 트랙 메타데이터에 연결된 티블은 track_metadata_tbl로 미리 정의되어 있어요.
track_metadata_tbl에서artist_name열의 고유 값을 찾으세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___