将 Spark DataFrame 转为 Pandas
假设您已经在海量数据集上运行了查询,并把结果聚合成更易处理的规模。
有时,将这张表拿到本地,配合 pandas 等工具处理,会更合适。借助 .toPandas() 方法,Spark DataFrame 可以轻松完成这一点。对 Spark DataFrame 调用该方法即可返回对应的 pandas DataFrame。就是这么简单!
这一次的查询会统计从 SEA 和 PDX 飞往各机场的航班数量。
请记住,您的工作区中已经有名为 spark 的 SparkSession!
本练习是课程的一部分
PySpark 基础
练习说明
- 使用
.sql()方法运行查询。将结果保存为flight_counts。 - 在
flight_counts上使用.toPandas()方法,创建名为pd_counts的pandasDataFrame。 - 在控制台打印
pd_counts的.head()。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"
# Run the query
flight_counts = ____
# Convert the results to a pandas DataFrame
pd_counts = ____
# Print the head of pd_counts
print(____)