Markera värden i fördelningen
Ibland behöver du bearbeta dina data för att skapa en bättre visualisering. Två metoder som hanterar saknade värden är .dropna() och .fillna(). Du kan också ta bort outliers genom att filtrera poster som överstiger eller understiger en viss percentil med hjälp av ett villkor och .quantile() på en specifik kolumn.
I videon såg du också hur man framhäver ett visst värde i ett diagram genom att lägga till en vertikal linje vid position x längs axlarna:
Axes.axvline(x=0, color=None, ...)
I den här övningen tittar du en sista gång på den globala inkomstfördelningen. Du tar bort outliers över den 95:e percentilen, ritar fördelningen och markerar både medelvärdet och medianvärdet. pandas som pd, seaborn som sns och matplotlib.pyplot som plt har importerats, och DataFrame:n income från tidigare övningar finns tillgänglig i din arbetsyta.
Den här övningen är en del av kursen
Importera och hantera finansiell data i Python
Övningsinstruktioner
- Tilldela kolumnen
'Income per Capita'tillinc_per_capita. - Filtrera så att endast de rader i
inc_per_capitasom är lägre än den 95:e percentilen behålls. Tilldela resultatet till samma variabel. - Rita ett histogram med standardinställningar för den filtrerade versionen av
inc_per_capitaoch tilldela det tillax. - Använd
ax.axvline()medcolor='b'för att markera medelvärdet avinc_per_capitai blått. - Använd
ax.axvline()medcolor='g'för att markera medianvärdet i grönt. Visa resultatet!
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create inc_per_capita
inc_per_capita = ____
# Filter out incomes above the 95th percentile
inc_per_capita = inc_per_capita[____ < ____]
# Plot histogram and assign to ax
ax = ____
# Highlight mean
ax.axvline(inc_per_capita.mean(), color='b')
# Highlight median
ax.axvline(inc_per_capita.median(), color='g')
# Show the plot
plt.show()