PySpark MLlib 算法
在 PySpark shell 中使用任何机器学习算法之前,您需要先导入 pyspark.mllib 库的相关子模块,然后为具体的机器学习任务选择合适的类。
在本练习中,您将学习如何导入 pyspark.mllib 的不同子模块,以及执行协同过滤、分类和聚类算法所需的类。
本练习是课程的一部分
使用 PySpark 的大数据基础
练习说明
- 导入
pyspark.mllib的 recommendation 子模块和 Alternating Least Squares 类。 - 导入
pyspark.mllib的 classification 子模块和 Logistic Regression with LBFGS 类。 - 导入
pyspark.mllib的 clustering 子模块和 kmeans 类。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import the library for ALS
from pyspark.mllib.____ import ____
# Import the library for Logistic Regression
from ____.____.____ import ____
# Import the library for Kmeans
from ____.____.____ ____ ____