Identyfikacja wartości ekstremalnych
Masz już DataFrame z danymi o procentowym udziale Latynosów w każdym stanie według rasowej autoidentyfikacji – czas go dokładniej zbadać. Zacznij od utworzenia wykresu pudełkowego za pomocą seaborn.
Następnie znajdziesz stany z największym lub najmniejszym odsetkiem Latynosów identyfikujących się z określoną rasą. W tym celu zastosuj metodę squeeze(). Konwertuje ona jednoierszowy DataFrame na serię (nie ma żadnego efektu w przypadku DataFrame z więcej niż jednym wierszem).
Zaimportowano bibliotekę pandas. Wczytano DataFrame states_hr, który zawiera odsetki rasowej autoidentyfikacji dla 7 różnych kategorii rasowych.
To ćwiczenie jest częścią kursu
Analiza danych spisowych USA w Pythonie
Instrukcje do ćwiczenia
- Utwórz wykres pudełkowy, ustawiając parametr
datana nazwę DataFrame. (orient = "h"wyświetli wykresy pudełkowe poziomo.) - Używając
squeeze, wyświetl stan z największą wartością w kolumniehispanic_white. - Używając
squeeze, wyświetl stan z najmniejszą wartością w kolumniehispanic_other. - Zwróć uwagę, że bardzo niewielu Latynosów identyfikuje się jako Azjaci, ale jeden stan wyraźnie odbiega od reszty jako wartość odstająca. Używając
squeeze, wyświetl stan z największą wartością w kolumniehispanic_asian.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()
# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()
# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)