将 CSV 加载到 DataFrame
在上一个练习中,您已经看到如何从 RDD 创建 DataFrame。通常,从 CSV 文件加载数据是创建 DataFrame 最常见的方法。本练习中,您将使用已作为 file_path 提供给您的 people.csv 文件创建一个 PySpark DataFrame,并确认创建的对象确实是一个 PySpark DataFrame。
请注意,您的工作区中已经有 SparkSession spark,以及变量 file_path(指向 people.csv 的路径)。
本练习是课程的一部分
使用 PySpark 的大数据基础
练习说明
- 使用变量
file_path(people.csv的路径)创建一个 DataFrame。 - 确认输出对象为 PySpark DataFrame。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)
# Check the type of people_df
print("The type of people_df is", ____(people_df))