ПочатиПочніть безкоштовно

Частина 3: Візуалізація даних

Візуалізація даних важлива для розвідувального аналізу даних (EDA). Датафрейм PySpark краще підходить для візуалізації, ніж RDD, завдяки своїй структурі та схемі.

У цій третій частині ви створите гістограму віку всіх гравців із Німеччини з датафрейму, який ви створили в попередній вправі. Для цього спочатку перетворіть датафрейм PySpark на датафрейм Pandas і скористайтеся функцією plot() з matplotlib, щоб побудувати графік густини віку всіх гравців із Німеччини.

Пам'ятайте, що у вашому робочому середовищі вже доступні SparkSession spark, тимчасова таблиця fifa_df_table та датафрейм fifa_df_germany_age.

Ця вправа є частиною курсу

Основи Big Data з PySpark

Переглянути курс

Інструкції до вправи

  • Перетворіть fifa_df_germany_age на датафрейм Pandas fifa_df_germany_age_pandas.
  • Згенеруйте графік густини для стовпця 'Age' з датафрейму Pandas fifa_df_germany_age_pandas.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()

# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()
Редагувати та запускати код