Zacznij terazZacznij za darmo

Identyfikacja wartości ekstremalnych

Masz już DataFrame z danymi o procentowym udziale Latynosów w każdym stanie według rasowej autoidentyfikacji – czas go dokładniej zbadać. Zacznij od utworzenia wykresu pudełkowego za pomocą seaborn.

Następnie znajdziesz stany z największym lub najmniejszym odsetkiem Latynosów identyfikujących się z określoną rasą. W tym celu zastosuj metodę squeeze(). Konwertuje ona jednoierszowy DataFrame na serię (nie ma żadnego efektu w przypadku DataFrame z więcej niż jednym wierszem).

Zaimportowano bibliotekę pandas. Wczytano DataFrame states_hr, który zawiera odsetki rasowej autoidentyfikacji dla 7 różnych kategorii rasowych.

To ćwiczenie jest częścią kursu

Analiza danych spisowych USA w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz wykres pudełkowy, ustawiając parametr data na nazwę DataFrame. (orient = "h" wyświetli wykresy pudełkowe poziomo.)
  • Używając squeeze, wyświetl stan z największą wartością w kolumnie hispanic_white.
  • Używając squeeze, wyświetl stan z najmniejszą wartością w kolumnie hispanic_other.
  • Zwróć uwagę, że bardzo niewielu Latynosów identyfikuje się jako Azjaci, ale jeden stan wyraźnie odbiega od reszty jako wartość odstająca. Używając squeeze, wyświetl stan z największą wartością w kolumnie hispanic_asian.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()

# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()

# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)
Edytuj i uruchom kod