ÎncepețiÎncepe gratuit

Matrice de dispersie a coloanelor numerice

Ai explorat noile date despre piețele agricole și ai observat că setul de date este destul de larg – cu multe coloane de informații pentru fiecare piață. În loc să parcurgi laborios fiecare combinație de coloane numerice și să creezi grafice de dispersie separate pentru a analiza corelațiile, alegi să construiești o matrice de dispersie folosind funcția built-in din pandas.

Mărind dimensiunea figurii cu argumentul figsize, oferi spațiu de respirație acestei vizualizări dense. Deoarece punctele se vor suprapune mult, reducerea opacității lor va ajuta la evidențierea densității acestor suprapuneri.

Acest exercițiu face parte din cursul

Îmbunătățirea vizualizărilor de date în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Filtrează coloanele DataFrame-ului markets la numeric_columns, astfel încât matricea de dispersie să afișeze doar coloanele numerice non-binare.
  • Mărește dimensiunea figurii la 15 pe 10 pentru a evita aglomerarea.
  • Reduce opacitatea punctelor la 50% pentru a evidenția zonele de suprapunere.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Select just the numeric columns (exluding individual goods)
numeric_columns = ['lat', 'lon', 'months_open', 'num_items_sold', 'state_pop']

# Make a scatter matrix of numeric columns
pd.plotting.scatter_matrix(markets[____], 
                             # Make figure large to show details
                             figsize = ____, 
                           # Lower point opacity to show overlap
                           alpha = ____)

plt.show()
Editează și rulează codul