Evidenziare valori nella distribuzione
A volte è necessario manipolare i dati per creare una visualizzazione migliore. Due metodi che gestiscono i valori mancanti sono .dropna() e .fillna(). Puoi anche rimuovere gli outlier filtrando le voci al di sopra o al di sotto di un certo percentile applicando una condizione con .quantile() a una colonna specifica.
Nel video hai anche visto come mettere in evidenza un valore specifico in un grafico aggiungendo una linea verticale in posizione x sugli assi:
Axes.axvline(x=0, color=None, ...)
In questo esercizio, darai un’ultima occhiata alla distribuzione del reddito globale, poi rimuoverai gli outlier sopra il 95° percentile, traccerai la distribuzione e metterai in evidenza sia la media sia la mediana. pandas come pd, seaborn come sns e matplotlib.pyplot come plt sono stati importati e il DataFrame income degli esercizi precedenti è disponibile nel tuo workspace.
Questo esercizio fa parte del corso
Importing and Managing Financial Data in Python
Istruzioni dell'esercizio
- Assegna la colonna
'Income per Capita'ainc_per_capita. - Filtra per mantenere solo le righe di
inc_per_capitainferiori al 95° percentile. Riassegna alla stessa variabile. - Traccia un istogramma predefinito per la versione filtrata di
inc_per_capitae assegnalo aax. - Usa
ax.axvline()concolor='b'per evidenziare in blu la media diinc_per_capita, - Usa
ax.axvline()concolor='g'per evidenziare in verde la mediana. Mostra il risultato!
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Create inc_per_capita
inc_per_capita = ____
# Filter out incomes above the 95th percentile
inc_per_capita = inc_per_capita[____ < ____]
# Plot histogram and assign to ax
ax = ____
# Highlight mean
ax.axvline(inc_per_capita.mean(), color='b')
# Highlight median
ax.axvline(inc_per_capita.median(), color='g')
# Show the plot
plt.show()