Bắt đầu ngayBắt đầu miễn phí

Dùng Spark trong Python

Bước đầu tiên để dùng Spark là kết nối tới một cụm máy (cluster).

Trong thực tế, cụm máy sẽ chạy trên một máy chủ từ xa, máy này kết nối với tất cả các nút khác. Sẽ có một máy tính gọi là master chịu trách nhiệm chia nhỏ dữ liệu và tác vụ tính toán. Master kết nối với các máy tính còn lại trong cụm, gọi là worker. Master gửi dữ liệu và phép tính cho các worker thực thi, rồi chúng gửi kết quả ngược lại cho master.

Khi mới bắt đầu với Spark, chạy cụm máy ngay trên máy cục bộ sẽ đơn giản hơn. Vì vậy, trong khóa học này, thay vì kết nối tới một máy khác, mọi phép tính sẽ chạy trên máy chủ của DataCamp trong một cụm mô phỏng.

Tạo kết nối đơn giản như việc khởi tạo một thể hiện của lớp SparkContext. Hàm khởi tạo của lớp nhận một vài tham số tùy chọn để bạn chỉ định các thuộc tính của cụm mà bạn đang kết nối.

Một đối tượng chứa tất cả các thuộc tính này có thể được tạo bằng hàm khởi tạo SparkConf(). Xem tài liệu để biết đầy đủ chi tiết!

Trong phần còn lại của khóa học, bạn sẽ có sẵn một SparkContext tên là sc trong không gian làm việc của mình.

Làm sao bạn kết nối tới một cụm Spark từ PySpark?

Bài tập này là một phần của khóa học

Nền tảng về PySpark

Xem khóa học

Bài tập tương tác thực hành

Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi

Bắt đầu bài tập