在 PySpark shell 中加载数据
在 PySpark 中,计算是通过对分布式集合执行操作来表达的,这些集合会在集群上自动并行化。上一个练习中,您已经看到了将列表加载为并行化集合的示例。本练习中,您将从本地文件在 PySpark shell 中加载数据。
请记住,您的工作空间中已经提供了 SparkContext sc 和变量 file_path(指向 README.md 文件的路径)。
本练习是课程的一部分
使用 PySpark 的大数据基础
练习说明
- 在 PySpark shell 中加载本地文本文件
README.md。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load a local file into PySpark shell
lines = sc.____(file_path)