Partea 3: Vizualizarea datelor
Vizualizarea datelor este esențială în analiza exploratorie a datelor (EDA). DataFrame-ul PySpark este ideal pentru vizualizarea datelor față de RDD-uri, datorită structurii și schemei sale bine definite.
În această a treia parte, vei crea o histogramă a vârstelor tuturor jucătorilor din Germania, folosind DataFrame-ul creat în exercițiul anterior. Mai întâi, vei converti DataFrame-ul PySpark într-un DataFrame Pandas, apoi vei folosi funcția plot() din matplotlib pentru a genera un grafic de densitate al vârstelor jucătorilor din Germania.
Reține că ai deja disponibile în spațiul de lucru un SparkSession spark, un tabel temporar fifa_df_table și un DataFrame fifa_df_germany_age.
Acest exercițiu face parte din cursul
Fundamentele Big Data cu PySpark
Instrucțiuni pentru exercițiu
- Convertește
fifa_df_germany_ageîn DataFrame-ul Pandasfifa_df_germany_age_pandas. - Generează un grafic de densitate al coloanei 'Age' din DataFrame-ul Pandas
fifa_df_germany_age_pandas.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()
# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()