开始使用免费开始使用

在 PySpark shell 中加载数据

在 PySpark 中,计算是通过对分布式集合执行操作来表达的,这些集合会在集群上自动并行化。上一个练习中,您已经看到了将列表加载为并行化集合的示例。本练习中,您将从本地文件在 PySpark shell 中加载数据。

请记住,您的工作空间中已经提供了 SparkContext sc 和变量 file_path(指向 README.md 文件的路径)。

本练习是课程的一部分

使用 PySpark 的大数据基础

查看课程

练习说明

  • 在 PySpark shell 中加载本地文本文件 README.md

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Load a local file into PySpark shell
lines = sc.____(file_path)
编辑并运行代码