开始使用免费开始使用

省去中间环节

现在您已经知道如何通过 pandas 把数据放入 Spark,但您可能在想:为什么还要绕到 pandas 呢?直接把文本文件读入 Spark 不更省事吗?当然更简单!

幸运的是,您的 SparkSession 有一个 .read 属性,里面提供了多种方法,可以把不同数据源读入为 Spark DataFrame。用这些方法,您就能像创建常规 pandas DataFrame 一样,从 .csv 文件创建一个 DataFrame!

变量 file_path 是字符串,指向文件 airports.csv 的路径。该文件包含全球各地不同机场的信息。

名为 sparkSparkSession 已在您的工作区中可用。

本练习是课程的一部分

PySpark 基础

查看课程

练习说明

  • 使用 .read.csv() 方法创建名为 airports 的 Spark DataFrame。
    • 第一个参数是 file_path
    • 传入参数 header=True,让 Spark 从文件首行读取列名。
  • 调用 .show() 打印该 DataFrame。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"

# Read in the airports data
airports = ____.____.____(____, ____=____)

# Show the data
____.____()
编辑并运行代码