Wizualizacja wielu kategorii
Do tej pory w tym rozdziale rozpatrywaliśmy różnice w zmiennej numerycznej między dwiema kategoriami. Oczywiście wiele zbiorów danych zawiera więcej kategorii. Zanim przystąpisz do testowania wielu kategorii, warto przeprowadzić eksploracyjną analizę danych (EDA) – obliczyć statystyki podsumowujące dla każdej grupy i zwizualizować rozkłady zmiennej numerycznej dla każdej kategorii za pomocą wykresów pudełkowych.
Wrócimy tu do danych o opóźnionych dostawach i sprawdzimy, jak cena opakowania (pack_price) różni się między trzema trybami wysyłki (shipment_mode): "Air", "Air Charter" i "Ocean".
Zbiór late_shipments jest dostępny; pandas i matplotlib.pyplot są załadowane ze standardowymi aliasami, a seaborn jest załadowany jako sns.
To ćwiczenie jest częścią kursu
Testowanie hipotez w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Calculate the mean pack_price for each shipment_mode
xbar_pack_by_mode = ____
# Print the grouped means
print(xbar_pack_by_mode)