开始使用免费开始使用

第 3 部分:数据可视化

数据可视化对探索性数据分析(EDA)非常重要。与 RDD 相比,PySpark DataFrame 由于自带结构和模式,更适合用于数据可视化。

在第三部分中,您将基于上一个练习创建的 DataFrame,绘制德国队所有球员年龄的直方图。为此,您将先把 PySpark DataFrame 转换为 Pandas DataFrame,然后使用 matplotlib 的 plot() 函数绘制德国球员年龄的核密度图。

请记住,工作区中已经提供 SparkSession spark、临时表 fifa_df_table,以及 DataFrame fifa_df_germany_age

本练习是课程的一部分

使用 PySpark 的大数据基础

查看课程

练习说明

  • fifa_df_germany_age 转换为 Pandas DataFrame fifa_df_germany_age_pandas
  • 基于 fifa_df_germany_age_pandas 中的 'Age' 列生成一张核密度图。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()

# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()
编辑并运行代码