НачатьНачать бесплатно

Матрица диаграмм рассеяния для числовых столбцов

Вы изучили новые данные о фермерских рынках и обнаружили, что таблица довольно широкая – для каждого рынка представлено множество столбцов с информацией. Вместо того чтобы вручную перебирать все комбинации числовых столбцов и строить отдельные диаграммы рассеяния для анализа корреляций, вы решаете воспользоваться встроенной функцией pandas для построения матрицы диаграмм рассеяния.

Увеличение размера фигуры с помощью аргумента figsize поможет сделать плотную визуализацию более читаемой. Поскольку точки будут сильно перекрываться, уменьшение их прозрачности позволит лучше отобразить плотность этих перекрытий.

Это упражнение является частью курса

Улучшение визуализации данных в Python

Посмотреть курс

Инструкции к упражнению

  • Отфильтруйте столбцы DataFrame markets, оставив только numeric_columns, чтобы матрица диаграмм рассеяния отображала лишь числовые небинарные столбцы.
  • Увеличьте размер фигуры до 15 на 10, чтобы избежать нагромождения элементов.
  • Уменьшите непрозрачность точек до 50%, чтобы показать области перекрытия.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Select just the numeric columns (exluding individual goods)
numeric_columns = ['lat', 'lon', 'months_open', 'num_items_sold', 'state_pop']

# Make a scatter matrix of numeric columns
pd.plotting.scatter_matrix(markets[____], 
                             # Make figure large to show details
                             figsize = ____, 
                           # Lower point opacity to show overlap
                           alpha = ____)

plt.show()
Редактировать и запускать код