RDD 생성하기
PySpark에서는 RDD(Resilient Distributed Dataset)를 여러 방법으로 만들 수 있어요. 이미 DataFrame에 익숙하시니, 이번에는 DataFrame을 사용해 RDD를 만들어 보겠습니다. 작업 공간에는 이미 spark라는 SparkSession이 준비되어 있어요!
이 연습은 강의의 일부입니다
PySpark 입문
연습 안내
- 제공된 리스트로부터
df라는 DataFrame을 만드세요. - DataFrame을 RDD로 변환하세요.
- 결과 RDD를 collect한 뒤 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create a DataFrame
df = spark.____("salaries.csv", header=True, inferSchema=True)
# Convert DataFrame to RDD
rdd = df.____
# Show the RDD's contents
rdd.____
print(rdd)