开始使用免费开始使用

组装列

数据准备的最后一步是把所有自变量列合并到一个单独的列中。

一个"更新过的"flights 数据(已包含前面几个练习中的所有更改)具有以下自变量列:

  • mondomdow
  • carrier_idx(由 carrier 索引得到的值)
  • org_idx(由 org 索引得到的值)
  • km
  • depart
  • duration

注意:show() 方法中使用参数 truncate=False 可防止输出中的数据被截断。

本练习是课程的一部分

使用 PySpark 进行机器学习

查看课程

练习说明

  • 导入用于组装自变量的类。
  • 创建一个 assembler 对象,以便将自变量列合并为单一列。
  • 使用该 assembler 生成一个新的汇总列。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import the necessary class
from pyspark.ml.feature import ____

# Create an assembler object
assembler = ____(inputCols=[
    ____
], outputCol='features')

# Consolidate predictor columns
flights_assembled = assembler.____(____)

# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)
编辑并运行代码