组装列
数据准备的最后一步是把所有自变量列合并到一个单独的列中。
一个"更新过的"flights 数据(已包含前面几个练习中的所有更改)具有以下自变量列:
mon、dom和dowcarrier_idx(由carrier索引得到的值)org_idx(由org索引得到的值)kmdepartduration
注意: 在 show() 方法中使用参数 truncate=False 可防止输出中的数据被截断。
本练习是课程的一部分
使用 PySpark 进行机器学习
练习说明
- 导入用于组装自变量的类。
- 创建一个 assembler 对象,以便将自变量列合并为单一列。
- 使用该 assembler 生成一个新的汇总列。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)