Частина 3: Візуалізація даних
Візуалізація даних важлива для розвідувального аналізу даних (EDA). Датафрейм PySpark краще підходить для візуалізації, ніж RDD, завдяки своїй структурі та схемі.
У цій третій частині ви створите гістограму віку всіх гравців із Німеччини з датафрейму, який ви створили в попередній вправі. Для цього спочатку перетворіть датафрейм PySpark на датафрейм Pandas і скористайтеся функцією plot() з matplotlib, щоб побудувати графік густини віку всіх гравців із Німеччини.
Пам'ятайте, що у вашому робочому середовищі вже доступні SparkSession spark, тимчасова таблиця fifa_df_table та датафрейм fifa_df_germany_age.
Ця вправа є частиною курсу
Основи Big Data з PySpark
Інструкції до вправи
- Перетворіть
fifa_df_germany_ageна датафрейм Pandasfifa_df_germany_age_pandas. - Згенеруйте графік густини для стовпця 'Age' з датафрейму Pandas
fifa_df_germany_age_pandas.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()
# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()