ÎncepețiÎncepe gratuit

Partea 3: Vizualizarea datelor

Vizualizarea datelor este esențială în analiza exploratorie a datelor (EDA). DataFrame-ul PySpark este ideal pentru vizualizarea datelor față de RDD-uri, datorită structurii și schemei sale bine definite.

În această a treia parte, vei crea o histogramă a vârstelor tuturor jucătorilor din Germania, folosind DataFrame-ul creat în exercițiul anterior. Mai întâi, vei converti DataFrame-ul PySpark într-un DataFrame Pandas, apoi vei folosi funcția plot() din matplotlib pentru a genera un grafic de densitate al vârstelor jucătorilor din Germania.

Reține că ai deja disponibile în spațiul de lucru un SparkSession spark, un tabel temporar fifa_df_table și un DataFrame fifa_df_germany_age.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Convertește fifa_df_germany_age în DataFrame-ul Pandas fifa_df_germany_age_pandas.
  • Generează un grafic de densitate al coloanei 'Age' din DataFrame-ul Pandas fifa_df_germany_age_pandas.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()

# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()
Editează și rulează codul