외부 데이터셋으로부터의 RDD
PySpark는 HDFS(Hadoop Distributed File System), Amazon S3 버킷 등과 같은 외부 스토리지에 저장된 파일로부터 손쉽게 RDD를 만들 수 있어요. 하지만 가장 일반적인 방법은 로컬 파일 시스템에 저장된 파일로부터 RDD를 생성하는 것입니다. 이 방법은 파일 경로를 입력으로 받아 파일을 줄 단위의 컬렉션으로 읽어들입니다. 이번 연습에서는 작업 공간에 이미 준비된 파일 이름 README.md의 파일 경로(file_path)로부터 RDD를 만들어 보겠습니다.
작업 공간에는 이미 SparkContext sc가 준비되어 있다는 점을 기억하세요.
이 연습은 강의의 일부입니다
PySpark로 배우는 빅데이터 기초
연습 안내
- PySpark 셸에서
file_path를 출력하세요. file_path로부터fileRDD라는 이름의 RDD를 생성하세요.- 생성한
fileRDD의 타입을 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Print the file_path
print("The file_path is", ____)
# Create a fileRDD from file_path
fileRDD = sc.____(file_path)
# Check the type of fileRDD
print("The file type of fileRDD is", type(____))