Wyróżnianie wartości w rozkładzie
Czasem trzeba przetworzyć dane, aby uzyskać lepszą wizualizację. Dwie metody, które pomogą poradzić sobie z brakującymi wartościami, to .dropna() i .fillna(). Można też usunąć wartości odstające, filtrując wpisy powyżej lub poniżej określonego percentyla – wystarczy zastosować warunek z .quantile() do wybranej kolumny.
W wideo pokazano również, jak wyróżnić konkretną wartość na wykresie, dodając pionową linię w pozycji x na osiach:
Axes.axvline(x=0, color=None, ...)
W tym ćwiczeniu przyjrzysz się globalnemu rozkładowi dochodów, usuniesz wartości odstające powyżej 95. percentyla, wykreślisz rozkład i zaznaczysz na nim zarówno średnią, jak i medianę. Biblioteki pandas jako pd, seaborn jako sns oraz matplotlib.pyplot jako plt zostały już zaimportowane, a ramka danych income z poprzednich ćwiczeń jest dostępna w twoim środowisku pracy.
To ćwiczenie jest częścią kursu
Importowanie i zarządzanie danymi finansowymi w Pythonie
Instrukcje do ćwiczenia
- Przypisz kolumnę
'Income per Capita'do zmiennejinc_per_capita. - Przefiltruj dane tak, aby zachować tylko te wiersze
inc_per_capita, których wartości są niższe od 95. percentyla. Zapisz wynik do tej samej zmiennej. - Wykreśl domyślny histogram dla przefiltrowanej wersji
inc_per_capitai przypisz go doax. - Użyj
ax.axvline()z argumentemcolor='b', aby zaznaczyć średniąinc_per_capitana niebiesko. - Użyj
ax.axvline()z argumentemcolor='g', aby zaznaczyć medianę na zielono. Wyświetl wynik!
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create inc_per_capita
inc_per_capita = ____
# Filter out incomes above the 95th percentile
inc_per_capita = inc_per_capita[____ < ____]
# Plot histogram and assign to ax
ax = ____
# Highlight mean
ax.axvline(inc_per_capita.mean(), color='b')
# Highlight median
ax.axvline(inc_per_capita.median(), color='g')
# Show the plot
plt.show()