Python에서 Spark 사용하기
Spark를 사용하려면 가장 먼저 클러스터에 연결해야 해요.
실무에서는 클러스터가 모든 노드와 연결된 원격 머신에 호스팅되는 경우가 많아요. 데이터와 연산을 분할하는 역할을 하는 컴퓨터를 마스터라고 부릅니다. 마스터는 클러스터의 다른 컴퓨터들, 즉 워커와 연결되어 있어요. 마스터는 워커에게 실행할 데이터와 계산 작업을 보내고, 워커는 결과를 마스터에게 다시 전달합니다.
Spark를 처음 시작할 때는 로컬에서 클러스터를 실행하는 편이 더 간단해요. 그래서 이 강의에서는 다른 컴퓨터에 연결하는 대신, DataCamp의 서버에서 시뮬레이션된 클러스터로 모든 계산을 수행합니다.
연결을 만드는 방법은 SparkContext 클래스를 인스턴스화하는 것만큼 간단해요. 이 클래스의 생성자에는 연결하려는 클러스터의 속성을 지정할 수 있는 선택적 인자가 있어요.
이 모든 속성을 담은 객체는 SparkConf() 생성자로 만들 수 있어요. 자세한 내용은 문서를 참고하세요!
이 강의의 나머지 내용에서는 작업 공간에 sc라는 이름의 SparkContext가 이미 준비되어 있어요.
PySpark에서 Spark 클러스터에 어떻게 연결하나요?
이 연습은 강의의 일부입니다
