Bắt đầu ngayBắt đầu miễn phí

Nạp dữ liệu trong PySpark shell

Trong PySpark, bạn biểu diễn phép tính của mình thông qua các thao tác trên các tập hợp phân tán, tự động được song song hóa trên cụm. Ở bài trước, bạn đã thấy ví dụ nạp một danh sách thành tập hợp song song; trong bài này, bạn sẽ nạp dữ liệu từ một tệp cục bộ trong PySpark shell.

Lưu ý: bạn đã có sẵn SparkContext sc và biến file_path (đường dẫn tới tệp README.md) trong không gian làm việc.

Bài tập này là một phần của khóa học

Nền tảng Big Data với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Nạp tệp văn bản cục bộ README.md trong PySpark shell.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Load a local file into PySpark shell
lines = sc.____(file_path)
Chỉnh sửa và Chạy Mã