Часть 3: Визуализация данных
Визуализация данных играет важную роль в разведочном анализе данных (EDA). PySpark DataFrame отлично подходит для визуализации благодаря своей структуре и схеме — в отличие от RDD.
В этой третьей части вы построите гистограмму возрастов всех игроков из Германии, используя DataFrame, созданный в предыдущем упражнении. Для этого сначала преобразуйте PySpark DataFrame в Pandas DataFrame, а затем воспользуйтесь функцией plot() из matplotlib, чтобы построить график плотности распределения возрастов игроков из Германии.
Напоминаем: в вашем рабочем пространстве уже доступны SparkSession spark, временная таблица fifa_df_table и DataFrame fifa_df_germany_age.
Это упражнение является частью курса
Основы Big Data с PySpark
Инструкции к упражнению
- Преобразуйте
fifa_df_germany_ageв Pandas DataFrame и сохраните результат в переменнуюfifa_df_germany_age_pandas. - Постройте график плотности по столбцу 'Age' из Pandas DataFrame
fifa_df_germany_age_pandas.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()
# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()