CommencezCommencez gratuitement

Partie 3 : Visualisation des données

La visualisation des données est essentielle pour l'analyse exploratoire des données (EDA). Le DataFrame PySpark convient très bien à la visualisation, comparativement aux RDD, grâce à sa structure et à son schéma intégrés.

Dans cette troisième partie, vous allez créer un histogramme des âges de tous les joueurs de l'Allemagne à partir du DataFrame que vous avez créé à l'exercice précédent. Pour ce faire, vous commencerez par convertir le DataFrame PySpark en DataFrame Pandas, puis vous utiliserez la fonction plot() de matplotlib pour créer un graphique de densité des âges de tous les joueurs de l'Allemagne.

Rappel : vous avez déjà à votre disposition une SparkSession spark, une table temporaire fifa_df_table et un DataFrame fifa_df_germany_age dans votre espace de travail.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Convertissez fifa_df_germany_age en DataFrame Pandas fifa_df_germany_age_pandas.
  • Générez un graphique de densité de la colonne 'Age' à partir du DataFrame Pandas fifa_df_germany_age_pandas.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()

# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()
Modifier et exécuter le code