Del 3: Datavisualisering
Datavisualisering är viktigt inom explorativ dataanalys (EDA). PySpark DataFrame lämpar sig väl för datavisualisering jämfört med RDD:er, tack vare sin inbyggda struktur och sitt schema.
I den här tredje delen ska du skapa ett histogram över åldrarna på alla spelare från Tyskland, baserat på den DataFrame som du skapade i föregående övning. Du konverterar först PySpark DataFrame till en Pandas DataFrame och använder sedan matplotlibs funktion plot() för att skapa ett densitetsdiagram över åldrarna på alla spelare från Tyskland.
Kom ihåg att du redan har en SparkSession spark, en temporär tabell fifa_df_table och en DataFrame fifa_df_germany_age tillgängliga i din arbetsyta.
Den här övningen är en del av kursen
Grunderna i Big Data med PySpark
Övningsinstruktioner
- Konvertera
fifa_df_germany_agetill Pandas DataFramefifa_df_germany_age_pandas. - Generera ett densitetsdiagram över kolumnen 'Age' från Pandas DataFrame
fifa_df_germany_age_pandas.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()
# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()