Matrice de dispersie a coloanelor numerice
Ai explorat noile date despre piețele agricole și ai observat că setul de date este destul de larg – cu multe coloane de informații pentru fiecare piață. În loc să parcurgi laborios fiecare combinație de coloane numerice și să creezi grafice de dispersie separate pentru a analiza corelațiile, alegi să construiești o matrice de dispersie folosind funcția built-in din pandas.
Mărind dimensiunea figurii cu argumentul figsize, oferi spațiu de respirație acestei vizualizări dense. Deoarece punctele se vor suprapune mult, reducerea opacității lor va ajuta la evidențierea densității acestor suprapuneri.
Acest exercițiu face parte din cursul
Îmbunătățirea vizualizărilor de date în Python
Instrucțiuni pentru exercițiu
- Filtrează coloanele DataFrame-ului
marketslanumeric_columns, astfel încât matricea de dispersie să afișeze doar coloanele numerice non-binare. - Mărește dimensiunea figurii la
15pe10pentru a evita aglomerarea. - Reduce opacitatea punctelor la 50% pentru a evidenția zonele de suprapunere.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Select just the numeric columns (exluding individual goods)
numeric_columns = ['lat', 'lon', 'months_open', 'num_items_sold', 'state_pop']
# Make a scatter matrix of numeric columns
pd.plotting.scatter_matrix(markets[____],
# Make figure large to show details
figsize = ____,
# Lower point opacity to show overlap
alpha = ____)
plt.show()