RDD từ tập dữ liệu bên ngoài
PySpark có thể dễ dàng tạo RDD từ các tệp lưu trên thiết bị lưu trữ bên ngoài như HDFS (Hadoop Distributed File System), Amazon S3 buckets, v.v. Tuy nhiên, cách phổ biến nhất để tạo RDD là từ các tệp lưu trên hệ thống tệp cục bộ của bạn. Cách này nhận một đường dẫn tệp và đọc nó như một tập hợp các dòng. Trong bài tập này, bạn sẽ tạo một RDD từ đường dẫn tệp (file_path) với tên tệp README.md đã có sẵn trong không gian làm việc của bạn.
Nhớ rằng bạn đã có sẵn một SparkContext sc trong không gian làm việc.
Bài tập này là một phần của khóa học
Nền tảng Big Data với PySpark
Hướng dẫn bài tập
- In
file_pathtrong shell PySpark. - Tạo một RDD tên
fileRDDtừfile_path. - In kiểu của
fileRDDvừa tạo.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Print the file_path
print("The file_path is", ____)
# Create a fileRDD from file_path
fileRDD = sc.____(file_path)
# Check the type of fileRDD
print("The file type of fileRDD is", type(____))