Bắt đầu ngayBắt đầu miễn phí

Lắp ráp một vector

Bước cuối cùng trong Pipeline là gộp tất cả các cột chứa đặc trưng của chúng ta vào một cột duy nhất. Việc này phải được thực hiện trước khi mô hình hóa vì mọi quy trình mô hình hóa của Spark đều kỳ vọng dữ liệu ở dạng này. Bạn có thể làm điều đó bằng cách lưu từng giá trị từ một cột dưới dạng một phần tử trong một vector. Khi đó, từ góc nhìn của mô hình, mỗi quan sát là một vector chứa toàn bộ thông tin về nó, cùng với một nhãn cho biết quan sát đó tương ứng với giá trị nào.

Vì lý do đó, phân hệ pyspark.ml.feature có một lớp tên là VectorAssembler. Transformer này sẽ lấy tất cả các cột bạn chỉ định và gộp chúng thành một cột vector mới.

Bài tập này là một phần của khóa học

Nền tảng về PySpark

Xem khóa học

Hướng dẫn bài tập

  • Tạo một VectorAssembler bằng cách gọi VectorAssembler() với inputCols là danh sách tên cột và outputCol"features".
    • Danh sách các cột là ["month", "air_time", "carrier_fact", "dest_fact", "plane_age"].

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Make a VectorAssembler
vec_assembler = VectorAssembler(inputCols=____, outputCol=____)
Chỉnh sửa và Chạy Mã