组装向量
Pipeline 的最后一步是将包含特征的所有列合并到一个单独的列中。建模前必须完成此步骤,因为每个 Spark 建模流程都要求数据是这种形式。您可以把每一列的值存入一个向量的条目中。这样,从模型的角度看,每条观测就是一个包含其全部信息的向量,再配上一个标签,告诉建模者该观测对应的取值。
因此,pyspark.ml.feature 子模块提供了一个名为 VectorAssembler 的类。这个 Transformer 会把您指定的所有列合并成一个新的向量列。
本练习是课程的一部分
PySpark 基础
练习说明
- 通过调用
VectorAssembler()创建一个VectorAssembler,将inputCols设为列名列表,将outputCol设为"features"。- 列名列表应为
["month", "air_time", "carrier_fact", "dest_fact", "plane_age"]。
- 列名列表应为
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Make a VectorAssembler
vec_assembler = VectorAssembler(inputCols=____, outputCol=____)