Матрица диаграмм рассеяния для числовых столбцов
Вы изучили новые данные о фермерских рынках и обнаружили, что таблица довольно широкая – для каждого рынка представлено множество столбцов с информацией. Вместо того чтобы вручную перебирать все комбинации числовых столбцов и строить отдельные диаграммы рассеяния для анализа корреляций, вы решаете воспользоваться встроенной функцией pandas для построения матрицы диаграмм рассеяния.
Увеличение размера фигуры с помощью аргумента figsize поможет сделать плотную визуализацию более читаемой. Поскольку точки будут сильно перекрываться, уменьшение их прозрачности позволит лучше отобразить плотность этих перекрытий.
Это упражнение является частью курса
Улучшение визуализации данных в Python
Инструкции к упражнению
- Отфильтруйте столбцы DataFrame
markets, оставив толькоnumeric_columns, чтобы матрица диаграмм рассеяния отображала лишь числовые небинарные столбцы. - Увеличьте размер фигуры до
15на10, чтобы избежать нагромождения элементов. - Уменьшите непрозрачность точек до 50%, чтобы показать области перекрытия.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Select just the numeric columns (exluding individual goods)
numeric_columns = ['lat', 'lon', 'months_open', 'num_items_sold', 'state_pop']
# Make a scatter matrix of numeric columns
pd.plotting.scatter_matrix(markets[____],
# Make figure large to show details
figsize = ____,
# Lower point opacity to show overlap
alpha = ____)
plt.show()