开始使用免费开始使用

机器学习流水线

在接下来的两章中,您将按部就班地走完整个机器学习流水线的每个阶段,从数据导入到模型评估。我们开始吧!

pyspark.ml 模块的核心是 TransformerEstimator 两个类。模块中的几乎所有其他类的行为都与这两个基础类类似。

Transformer 类具有 .transform() 方法,它接收一个 DataFrame 并返回一个新的 DataFrame;通常是在原始数据上追加一个新列。例如,您可以使用 Bucketizer 类把连续特征划分为离散区间,或用 PCA 类通过主成分分析降低数据集的维度。

Estimator 类都实现了 .fit() 方法。该方法同样接收一个 DataFrame,但不会返回另一个 DataFrame,而是返回一个模型对象。比如用于将以字符串形式保存的分类数据纳入模型的 StringIndexerModel,或用于分类或回归的随机森林算法模型 RandomForestModel

以下哪一项关于 Spark 中的机器学习是正确的?

本练习是课程的一部分

PySpark 基础

查看课程

动手互动练习

通过我们的互动练习之一,将理论转化为实践

开始练习