开始使用免费开始使用

PySpark MLlib 算法

在 PySpark shell 中使用任何机器学习算法之前,您需要先导入 pyspark.mllib 库的相关子模块,然后为具体的机器学习任务选择合适的类。

在本练习中,您将学习如何导入 pyspark.mllib 的不同子模块,以及执行协同过滤、分类和聚类算法所需的类。

本练习是课程的一部分

使用 PySpark 的大数据基础

查看课程

练习说明

  • 导入 pyspark.mllib 的 recommendation 子模块和 Alternating Least Squares 类。
  • 导入 pyspark.mllib 的 classification 子模块和 Logistic Regression with LBFGS 类。
  • 导入 pyspark.mllib 的 clustering 子模块和 kmeans 类。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import the library for ALS
from pyspark.mllib.____ import ____

# Import the library for Logistic Regression
from ____.____.____ import ____

# Import the library for Kmeans
from ____.____.____ ____ ____
编辑并运行代码