开始使用免费开始使用

将 CSV 加载到 DataFrame

在上一个练习中,您已经看到如何从 RDD 创建 DataFrame。通常,从 CSV 文件加载数据是创建 DataFrame 最常见的方法。本练习中,您将使用已作为 file_path 提供给您的 people.csv 文件创建一个 PySpark DataFrame,并确认创建的对象确实是一个 PySpark DataFrame。

请注意,您的工作区中已经有 SparkSession spark,以及变量 file_path(指向 people.csv 的路径)。

本练习是课程的一部分

使用 PySpark 的大数据基础

查看课程

练习说明

  • 使用变量 file_pathpeople.csv 的路径)创建一个 DataFrame。
  • 确认输出对象为 PySpark DataFrame。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)

# Check the type of people_df
print("The type of people_df is", ____(people_df))
编辑并运行代码