Nạp dữ liệu trong PySpark shell
Trong PySpark, bạn biểu diễn phép tính của mình thông qua các thao tác trên các tập hợp phân tán, tự động được song song hóa trên cụm. Ở bài trước, bạn đã thấy ví dụ nạp một danh sách thành tập hợp song song; trong bài này, bạn sẽ nạp dữ liệu từ một tệp cục bộ trong PySpark shell.
Lưu ý: bạn đã có sẵn SparkContext sc và biến file_path (đường dẫn tới tệp README.md) trong không gian làm việc.
Bài tập này là một phần của khóa học
Nền tảng Big Data với PySpark
Hướng dẫn bài tập
- Nạp tệp văn bản cục bộ
README.mdtrong PySpark shell.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load a local file into PySpark shell
lines = sc.____(file_path)