열 선택하기
Spark에 저장된 데이터 프레임을 다루는 가장 쉬운 방법은 dplyr 문법을 사용하는 것입니다. dplyr 문법으로 데이터 프레임을 조작하는 방법은 Data Manipulation with dplyr과 Joining Data with dplyr 강좌에서 자세히 다루지만, 이 강의의 다음 한 장 반 동안 핵심 내용을 모두 익히게 됩니다.
dplyr에는 데이터 프레임에 수행할 수 있는 다섯 가지 주요 동작이 있습니다. 열 선택, 행 필터링, 행 정렬, 열 변경 또는 새 열 추가, 요약 통계 계산입니다.
열 선택부터 시작해 보겠습니다. 이는 티블을 첫 번째 인수로 두고, 유지하고 싶은 열의 이름을 따옴표 없이 나열하여 select()를 호출하면 됩니다. dplyr 함수는 보통 magrittr의 파이프 연산자 %>%와 함께 사용합니다. 예를 들어 x, y, z 열을 선택하려면 다음과 같이 작성합니다.
a_tibble %>%
select(x, y, z)
sparklyr에서는 현재 대괄호 인덱싱을 지원하지 않습니다. 따라서 다음과 같은 코드는 사용할 수 없습니다.
a_tibble[, c("x", "y", "z")]
이 연습은 강의의 일부입니다
R에서 sparklyr로 시작하는 Spark
연습 안내
이미 spark_conn이라는 Spark 연결이 생성되어 있습니다. Spark에 저장된 트랙 메타데이터에 연결된 티블은 track_metadata_tbl로 미리 정의되어 있습니다.
select()를 사용해artist_name,release,title,year를 선택하세요.- 같은 작업을 대괄호 인덱싱으로도 시도해 보세요. 스포일러! 이 코드는 오류가 발생하므로
tryCatch()로 감싸 두었습니다.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___
# Try to select columns using [ ]
tryCatch({
# Selection code here
___
},
error = print
)