机器学习流水线
在接下来的两章中,您将按部就班地走完整个机器学习流水线的每个阶段,从数据导入到模型评估。我们开始吧!
pyspark.ml 模块的核心是 Transformer 和 Estimator 两个类。模块中的几乎所有其他类的行为都与这两个基础类类似。
Transformer 类具有 .transform() 方法,它接收一个 DataFrame 并返回一个新的 DataFrame;通常是在原始数据上追加一个新列。例如,您可以使用 Bucketizer 类把连续特征划分为离散区间,或用 PCA 类通过主成分分析降低数据集的维度。
Estimator 类都实现了 .fit() 方法。该方法同样接收一个 DataFrame,但不会返回另一个 DataFrame,而是返回一个模型对象。比如用于将以字符串形式保存的分类数据纳入模型的 StringIndexerModel,或用于分类或回归的随机森林算法模型 RandomForestModel。
以下哪一项关于 Spark 中的机器学习是不正确的?
本练习是课程的一部分
