Lắp ráp một vector
Bước cuối cùng trong Pipeline là gộp tất cả các cột chứa đặc trưng của chúng ta vào một cột duy nhất. Việc này phải được thực hiện trước khi mô hình hóa vì mọi quy trình mô hình hóa của Spark đều kỳ vọng dữ liệu ở dạng này. Bạn có thể làm điều đó bằng cách lưu từng giá trị từ một cột dưới dạng một phần tử trong một vector. Khi đó, từ góc nhìn của mô hình, mỗi quan sát là một vector chứa toàn bộ thông tin về nó, cùng với một nhãn cho biết quan sát đó tương ứng với giá trị nào.
Vì lý do đó, phân hệ pyspark.ml.feature có một lớp tên là VectorAssembler. Transformer này sẽ lấy tất cả các cột bạn chỉ định và gộp chúng thành một cột vector mới.
Bài tập này là một phần của khóa học
Nền tảng về PySpark
Hướng dẫn bài tập
- Tạo một
VectorAssemblerbằng cách gọiVectorAssembler()vớiinputColslà danh sách tên cột vàoutputCollà"features".- Danh sách các cột là
["month", "air_time", "carrier_fact", "dest_fact", "plane_age"].
- Danh sách các cột là
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Make a VectorAssembler
vec_assembler = VectorAssembler(inputCols=____, outputCol=____)