Bắt đầu ngayBắt đầu miễn phí

Machine Learning Pipelines

Trong hai chương tiếp theo, bạn sẽ đi qua từng bước của machine learning pipeline, từ nạp dữ liệu đến đánh giá mô hình. Bắt đầu thôi!

Cốt lõi của mô-đun pyspark.ml là các lớp TransformerEstimator. Hầu như mọi lớp khác trong mô-đun đều hoạt động tương tự hai lớp cơ bản này.

Các lớp Transformer có phương thức .transform() nhận vào một DataFrame và trả về một DataFrame mới; thường là bản gốc kèm thêm một cột mới. Ví dụ, bạn có thể dùng lớp Bucketizer để tạo các bin rời rạc từ một đặc trưng liên tục hoặc lớp PCA để giảm chiều dữ liệu của bạn bằng phân tích thành phần chính.

Tất cả các lớp Estimator đều triển khai phương thức .fit(). Các phương thức này cũng nhận vào một DataFrame, nhưng thay vì trả về một DataFrame khác, chúng trả về một đối tượng mô hình. Đó có thể là StringIndexerModel để đưa dữ liệu phân loại được lưu dưới dạng chuỗi vào mô hình của bạn, hoặc RandomForestModel dùng thuật toán random forest cho phân loại hoặc hồi quy.

Điều nào sau đây không đúng về machine learning trong Spark?

Bài tập này là một phần của khóa học

Nền tảng về PySpark

Xem khóa học

Bài tập tương tác thực hành

Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi

Bắt đầu bài tập