开始使用免费开始使用

RDD 转 DataFrame

与 RDD 类似,DataFrame 也是 Spark 中不可变且分布式的数据结构。虽然 RDD 是 Spark 的基础数据结构,但在 DataFrame 中处理数据通常比在 RDD 中更容易。因此,理解如何将 RDD 转换为 DataFrame 很有必要。

在本练习中,您将先使用已提供的 sample_list 创建一个 RDD。该 RDD 包含元组列表 ('Mona',20), ('Jennifer',34),('John',20), ('Jim',26),每个元组包含姓名和年龄。接着,您将使用该 RDD 和 schema(即包含 'Name' 和 'Age' 的列表)创建一个 DataFrame,最后确认输出对象是一个 PySpark DataFrame。

请记住,您的工作区中已提供 SparkContext sc 和 SparkSession spark

本练习是课程的一部分

使用 PySpark 的大数据基础

查看课程

练习说明

  • sample_list 创建一个 RDD。
  • 使用上述 RDD 和 schema 创建一个 PySpark DataFrame。
  • 确认输出对象为 PySpark DataFrame。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create an RDD from the list
rdd = sc.____(sample_list)

# Create a PySpark DataFrame
names_df = spark.createDataFrame(____, ____=['Name', 'Age'])

# Check the type of names_df
print("The type of names_df is", ____(names_df))
编辑并运行代码