찰떡궁합
R는 데이터 분석 코드를 빠르게 작성할 수 있게 해 줍니다. 약간만 신경 쓰면 읽기 쉬운 코드도 얼마든지 만들 수 있어, 유지보수도 수월해져요. 많은 경우, R은 코드 실행 속도도 충분히 빠릅니다.
하지만 R은 모든 데이터를 단일 머신의 메모리(RAM)에서 분석해야 합니다. 이 때문에 R로 다룰 수 있는 데이터 양에 한계가 생기죠. 이 문제를 해결하는 방법 가운데 하나가 Spark입니다.
Spark는 오픈 소스 클러스터 컴퓨팅 플랫폼입니다. 데이터를 여러 대의 머신에 분산해 계산을 수행할 수 있어, 사실상 무제한에 가까운 데이터도 분석할 수 있습니다. 두 기술은 서로를 강력하게 보완합니다. R와 Spark를 함께 사용하면 코드를 빠르게 작성하고, 실행도 빠르게 할 수 있어요!
sparklyr는 Spark 클러스터의 데이터를 R 코드로 다룰 수 있게 해 주는 R 패키지입니다. dplyr 인터페이스를 제공하므로, 로컬 머신의 데이터든 Spark 클러스터의 데이터든 (거의) 동일한 dplyr 스타일의 R 코드를 사용할 수 있습니다.
더 빠르게 가고 싶다면, 크게 외쳐 보세요!
이 연습은 강의의 일부입니다
