开始使用免费开始使用

将 Spark DataFrame 转为 Pandas

假设您已经在海量数据集上运行了查询,并把结果聚合成更易处理的规模。

有时,将这张表拿到本地,配合 pandas 等工具处理,会更合适。借助 .toPandas() 方法,Spark DataFrame 可以轻松完成这一点。对 Spark DataFrame 调用该方法即可返回对应的 pandas DataFrame。就是这么简单!

这一次的查询会统计从 SEA 和 PDX 飞往各机场的航班数量。

请记住,您的工作区中已经有名为 sparkSparkSession

本练习是课程的一部分

PySpark 基础

查看课程

练习说明

  • 使用 .sql() 方法运行查询。将结果保存为 flight_counts
  • flight_counts 上使用 .toPandas() 方法,创建名为 pd_countspandas DataFrame。
  • 在控制台打印 pd_counts.head()

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"

# Run the query
flight_counts = ____

# Convert the results to a pandas DataFrame
pd_counts = ____

# Print the head of pd_counts
print(____)
编辑并运行代码