第 3 部分:数据可视化
数据可视化对探索性数据分析(EDA)非常重要。与 RDD 相比,PySpark DataFrame 由于自带结构和模式,更适合用于数据可视化。
在第三部分中,您将基于上一个练习创建的 DataFrame,绘制德国队所有球员年龄的直方图。为此,您将先把 PySpark DataFrame 转换为 Pandas DataFrame,然后使用 matplotlib 的 plot() 函数绘制德国球员年龄的核密度图。
请记住,工作区中已经提供 SparkSession spark、临时表 fifa_df_table,以及 DataFrame fifa_df_germany_age。
本练习是课程的一部分
使用 PySpark 的大数据基础
练习说明
- 将
fifa_df_germany_age转换为 Pandas DataFramefifa_df_germany_age_pandas。 - 基于
fifa_df_germany_age_pandas中的 'Age' 列生成一张核密度图。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()
# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()