НачатьНачать бесплатно

Часть 3: Визуализация данных

Визуализация данных играет важную роль в разведочном анализе данных (EDA). PySpark DataFrame отлично подходит для визуализации благодаря своей структуре и схеме — в отличие от RDD.

В этой третьей части вы построите гистограмму возрастов всех игроков из Германии, используя DataFrame, созданный в предыдущем упражнении. Для этого сначала преобразуйте PySpark DataFrame в Pandas DataFrame, а затем воспользуйтесь функцией plot() из matplotlib, чтобы построить график плотности распределения возрастов игроков из Германии.

Напоминаем: в вашем рабочем пространстве уже доступны SparkSession spark, временная таблица fifa_df_table и DataFrame fifa_df_germany_age.

Это упражнение является частью курса

Основы Big Data с PySpark

Посмотреть курс

Инструкции к упражнению

  • Преобразуйте fifa_df_germany_age в Pandas DataFrame и сохраните результат в переменную fifa_df_germany_age_pandas.
  • Постройте график плотности по столбцу 'Age' из Pandas DataFrame fifa_df_germany_age_pandas.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()

# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()
Редактировать и запускать код