Část 3: Vizualizace dat
Vizualizace dat je důležitou součástí exploratorní analýzy dat (EDA). PySpark DataFrame je pro vizualizaci dat vhodnější než RDD díky své přirozené struktuře a schématu.
V této třetí části vytvoříš histogram věků všech hráčů z Německa z DataFrame, který jsi vytvořil/a v předchozím cvičení. Nejprve převedeš PySpark DataFrame na Pandas DataFrame a pomocí funkce plot() z matplotlibu vytvoříš graf hustoty věků všech hráčů z Německa.
Pamatuj, že ve svém pracovním prostředí máš k dispozici SparkSession spark, dočasnou tabulku fifa_df_table a DataFrame fifa_df_germany_age.
Toto cvičení je součástí kurzu
Big Data Fundamentals with PySpark
Pokyny k cvičení
- Převeď
fifa_df_germany_agena Pandas DataFramefifa_df_germany_age_pandas. - Vygeneruj graf hustoty sloupce 'Age' z Pandas DataFrame
fifa_df_germany_age_pandas.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()
# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()