Začněte nyníZačněte zdarma

Část 3: Vizualizace dat

Vizualizace dat je důležitou součástí exploratorní analýzy dat (EDA). PySpark DataFrame je pro vizualizaci dat vhodnější než RDD díky své přirozené struktuře a schématu.

V této třetí části vytvoříš histogram věků všech hráčů z Německa z DataFrame, který jsi vytvořil/a v předchozím cvičení. Nejprve převedeš PySpark DataFrame na Pandas DataFrame a pomocí funkce plot() z matplotlibu vytvoříš graf hustoty věků všech hráčů z Německa.

Pamatuj, že ve svém pracovním prostředí máš k dispozici SparkSession spark, dočasnou tabulku fifa_df_table a DataFrame fifa_df_germany_age.

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Převeď fifa_df_germany_age na Pandas DataFrame fifa_df_germany_age_pandas.
  • Vygeneruj graf hustoty sloupce 'Age' z Pandas DataFrame fifa_df_germany_age_pandas.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()

# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()
Upravit a spustit kód