시작하기무료로 시작하기

찰떡궁합

R는 데이터 분석 코드를 빠르게 작성할 수 있게 해 줍니다. 약간만 신경 쓰면 읽기 쉬운 코드도 얼마든지 만들 수 있어, 유지보수도 수월해져요. 많은 경우, R은 코드 실행 속도도 충분히 빠릅니다.

하지만 R은 모든 데이터를 단일 머신의 메모리(RAM)에서 분석해야 합니다. 이 때문에 R로 다룰 수 있는 데이터 양에 한계가 생기죠. 이 문제를 해결하는 방법 가운데 하나가 Spark입니다.

Spark는 오픈 소스 클러스터 컴퓨팅 플랫폼입니다. 데이터를 여러 대의 머신에 분산해 계산을 수행할 수 있어, 사실상 무제한에 가까운 데이터도 분석할 수 있습니다. 두 기술은 서로를 강력하게 보완합니다. R와 Spark를 함께 사용하면 코드를 빠르게 작성하고, 실행도 빠르게 할 수 있어요!

sparklyr는 Spark 클러스터의 데이터를 R 코드로 다룰 수 있게 해 주는 R 패키지입니다. dplyr 인터페이스를 제공하므로, 로컬 머신의 데이터든 Spark 클러스터의 데이터든 (거의) 동일한 dplyr 스타일의 R 코드를 사용할 수 있습니다.

더 빠르게 가고 싶다면, 크게 외쳐 보세요!

이 연습은 강의의 일부입니다

R에서 sparklyr로 시작하는 Spark

강의 보기

실습형 인터랙티브 연습문제

이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요

연습 시작