Spark 是一个分布式计算平台。它通过在一组计算机上分发数据和计算来提高效率。
一个 Spark 集群由多种硬件和软件组件协同组成。
以下哪一项不是 Spark 集群的一部分?
本练习是课程的一部分
通过我们的互动练习之一,将理论转化为实践
Spark 是用于处理大数据的框架。本章将介绍 Spark 和机器学习的背景知识。随后,您将学习如何使用 Python 连接 Spark 并加载 CSV 数据。
当前练习
在熟悉了如何将数据导入 Spark 之后,您将开始构建两类分类模型:决策树和逻辑回归。您还将了解几种数据准备的方法。
接下来,您将学习创建线性回归模型。您还会学习如何通过构造新预测变量来增强数据,以及一种稳健的方法来仅选择最相关的预测变量。
最后,您将学习如何提升模型的效率。您会了解如何使用流水线让代码更清晰、更易维护。随后,您将使用交叉验证更好地测试模型并选择合适的模型参数。最后,您还会接触两类集成模型。