Příliš mnoho kategorií
Někdy je místo v grafu omezené a potřebuješ zobrazit velké množství dat najednou. V tomto cvičení chceš ukázat roční vývoj každého znečišťující látky pro každé město z datasetu pollution. Trajektorie každé znečišťující látky bude vykreslena jako čára, jejíž hodnota na ose y odpovídá počtu směrodatných odchylek od ročního průměru. Na grafu tak bude najednou velké množství čar – příliš mnoho na to, aby se daly přehledně odlišit barvou.
Proto jsi se rozhodl/a zvýraznit jen malou podmnožinu kombinací města a znečišťující látky (wanted_combos). Tato podmnožina je pro tebe nejdůležitější, ostatní trajektorie pak poslouží jako cenný kontext pro srovnání. Aby zůstala pozornost soustředěná, nastavíš všem nezvýrazněným čarám stejnou „ostatní" barvu.
Toto cvičení je součástí kurzu
Vylepšení datových vizualizací v Pythonu
Pokyny k cvičení
- Uprav list comprehension tak, aby izoloval požadované kombinace města a znečišťující látky (
wanted_combos). - Nastav v liniovém grafu obarvení čar podle nově vytvořeného sloupce
color_catsve svém DataFrame. - Pomocí argumentu
unitsurčit jak, tj. ze kterého sloupce, mají být datové body spojeny do jednotlivých čar. - Vypni binning bodů pomocí argumentu
estimator.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Choose the combos that get distinct colors
wanted_combos = ['Vandenberg Air Force Base NO2', 'Long Beach CO', 'Cincinnati SO2']
# Assign a new column to DataFrame for isolating the desired combos
city_pol_month['color_cats'] = [x if x in ____ else 'other' for x in city_pol_month['city_pol']]
# Plot lines with color driven by new column and lines driven by original categories
sns.lineplot(x = "month",
y = "value",
hue = '____',
units = '____',
estimator = ____,
palette = 'Set2',
data = city_pol_month)
plt.show()