Kom igångKom igång gratis

Del 3: Datavisualisering

Datavisualisering är viktigt inom explorativ dataanalys (EDA). PySpark DataFrame lämpar sig väl för datavisualisering jämfört med RDD:er, tack vare sin inbyggda struktur och sitt schema.

I den här tredje delen ska du skapa ett histogram över åldrarna på alla spelare från Tyskland, baserat på den DataFrame som du skapade i föregående övning. Du konverterar först PySpark DataFrame till en Pandas DataFrame och använder sedan matplotlibs funktion plot() för att skapa ett densitetsdiagram över åldrarna på alla spelare från Tyskland.

Kom ihåg att du redan har en SparkSession spark, en temporär tabell fifa_df_table och en DataFrame fifa_df_germany_age tillgängliga i din arbetsyta.

Den här övningen är en del av kursen

Grunderna i Big Data med PySpark

Visa kurs

Övningsinstruktioner

  • Konvertera fifa_df_germany_age till Pandas DataFrame fifa_df_germany_age_pandas.
  • Generera ett densitetsdiagram över kolumnen 'Age' från Pandas DataFrame fifa_df_germany_age_pandas.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()

# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()
Redigera och kör kod