开始使用免费开始使用

组装向量

Pipeline 的最后一步是将包含特征的所有列合并到一个单独的列中。建模前必须完成此步骤,因为每个 Spark 建模流程都要求数据是这种形式。您可以把每一列的值存入一个向量的条目中。这样,从模型的角度看,每条观测就是一个包含其全部信息的向量,再配上一个标签,告诉建模者该观测对应的取值。

因此,pyspark.ml.feature 子模块提供了一个名为 VectorAssembler 的类。这个 Transformer 会把您指定的所有列合并成一个新的向量列。

本练习是课程的一部分

PySpark 基础

查看课程

练习说明

  • 通过调用 VectorAssembler() 创建一个 VectorAssembler,将 inputCols 设为列名列表,将 outputCol 设为 "features"
    • 列名列表应为 ["month", "air_time", "carrier_fact", "dest_fact", "plane_age"]

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Make a VectorAssembler
vec_assembler = VectorAssembler(inputCols=____, outputCol=____)
编辑并运行代码