省去中间环节
现在您已经知道如何通过 pandas 把数据放入 Spark,但您可能在想:为什么还要绕到 pandas 呢?直接把文本文件读入 Spark 不更省事吗?当然更简单!
幸运的是,您的 SparkSession 有一个 .read 属性,里面提供了多种方法,可以把不同数据源读入为 Spark DataFrame。用这些方法,您就能像创建常规 pandas DataFrame 一样,从 .csv 文件创建一个 DataFrame!
变量 file_path 是字符串,指向文件 airports.csv 的路径。该文件包含全球各地不同机场的信息。
名为 spark 的 SparkSession 已在您的工作区中可用。
本练习是课程的一部分
PySpark 基础
练习说明
- 使用
.read.csv()方法创建名为airports的 Spark DataFrame。- 第一个参数是
file_path。 - 传入参数
header=True,让 Spark 从文件首行读取列名。
- 第一个参数是
- 调用
.show()打印该 DataFrame。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"
# Read in the airports data
airports = ____.____.____(____, ____=____)
# Show the data
____.____()