Zacznij terazZacznij za darmo

Wyróżnianie wartości w rozkładzie

Czasem trzeba przetworzyć dane, aby uzyskać lepszą wizualizację. Dwie metody, które pomogą poradzić sobie z brakującymi wartościami, to .dropna() i .fillna(). Można też usunąć wartości odstające, filtrując wpisy powyżej lub poniżej określonego percentyla – wystarczy zastosować warunek z .quantile() do wybranej kolumny.

W wideo pokazano również, jak wyróżnić konkretną wartość na wykresie, dodając pionową linię w pozycji x na osiach:

Axes.axvline(x=0, color=None, ...)

W tym ćwiczeniu przyjrzysz się globalnemu rozkładowi dochodów, usuniesz wartości odstające powyżej 95. percentyla, wykreślisz rozkład i zaznaczysz na nim zarówno średnią, jak i medianę. Biblioteki pandas jako pd, seaborn jako sns oraz matplotlib.pyplot jako plt zostały już zaimportowane, a ramka danych income z poprzednich ćwiczeń jest dostępna w twoim środowisku pracy.

To ćwiczenie jest częścią kursu

Importowanie i zarządzanie danymi finansowymi w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Przypisz kolumnę 'Income per Capita' do zmiennej inc_per_capita.
  • Przefiltruj dane tak, aby zachować tylko te wiersze inc_per_capita, których wartości są niższe od 95. percentyla. Zapisz wynik do tej samej zmiennej.
  • Wykreśl domyślny histogram dla przefiltrowanej wersji inc_per_capita i przypisz go do ax.
  • Użyj ax.axvline() z argumentem color='b', aby zaznaczyć średnią inc_per_capita na niebiesko.
  • Użyj ax.axvline() z argumentem color='g', aby zaznaczyć medianę na zielono. Wyświetl wynik!

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create inc_per_capita
inc_per_capita = ____

# Filter out incomes above the 95th percentile
inc_per_capita = inc_per_capita[____ < ____]

# Plot histogram and assign to ax
ax = ____

# Highlight mean
ax.axvline(inc_per_capita.mean(), color='b')

# Highlight median
ax.axvline(inc_per_capita.median(), color='g')

# Show the plot
plt.show()
Edytuj i uruchom kod