開始使用免費開始

第 3 部分:資料視覺化

在探索式資料分析(EDA)中,資料視覺化非常重要。相較於 RDD,PySpark 的 DataFrame 由於具備結構與綱要(schema),更適合用於視覺化。

在這個第三部分,你將使用前一個練習建立的 DataFrame,為所有來自德國的球員年齡繪製直方圖。為此,你會先把 PySpark DataFrame 轉成 Pandas DataFrame,並使用 matplotlib 的 plot() 函式為德國球員的年齡建立機率密度圖。

記住,你的工作環境中已經有 SparkSession spark、暫存資料表 fifa_df_table,以及 DataFrame fifa_df_germany_age 可供使用。

本練習屬於課程

使用 PySpark 的 Big Data 基礎

檢視課程

練習說明

  • fifa_df_germany_age 轉換成 Pandas DataFrame fifa_df_germany_age_pandas
  • fifa_df_germany_age_pandas 的 'Age' 欄位產生一張機率密度圖。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()

# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()
編輯並執行程式碼