第 3 部分:資料視覺化
在探索式資料分析(EDA)中,資料視覺化非常重要。相較於 RDD,PySpark 的 DataFrame 由於具備結構與綱要(schema),更適合用於視覺化。
在這個第三部分,你將使用前一個練習建立的 DataFrame,為所有來自德國的球員年齡繪製直方圖。為此,你會先把 PySpark DataFrame 轉成 Pandas DataFrame,並使用 matplotlib 的 plot() 函式為德國球員的年齡建立機率密度圖。
記住,你的工作環境中已經有 SparkSession spark、暫存資料表 fifa_df_table,以及 DataFrame fifa_df_germany_age 可供使用。
本練習屬於課程
使用 PySpark 的 Big Data 基礎
練習說明
- 將
fifa_df_germany_age轉換成 Pandas DataFramefifa_df_germany_age_pandas。 - 從
fifa_df_germany_age_pandas的 'Age' 欄位產生一張機率密度圖。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()
# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()