시작하기무료로 시작하기

병렬화된 컬렉션으로부터의 RDD 생성

Resilient Distributed Dataset(RDD)는 Spark의 기본 추상화입니다. 변경 불가능한(immutable) 분산 객체 컬렉션을 의미해요. RDD는 Spark의 핵심이자 뼈대가 되는 데이터 타입이므로, 생성 방법을 이해하는 것이 중요합니다. 이 연습 문제에서는 단어 컬렉션으로부터 PySpark에서 첫 번째 RDD를 만들어 보겠습니다.

작업 공간에는 이미 SparkContext sc가 제공되어 있다는 점을 기억하세요.

이 연습은 강의의 일부입니다

PySpark로 배우는 빅데이터 기초

강의 보기

연습 안내

  • 단어로 이루어진 Python 리스트로부터 RDD라는 이름의 RDD를 생성하세요.
  • 생성된 객체가 RDD인지 확인하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])

# Print out the type of the created object
print("The type of RDD is", ____(RDD))
코드 편집 및 실행