Visualisera många kategorier
Hittills i det här kapitlet har vi bara tittat på skillnader i en numerisk variabel mellan två kategorier. Många datamängder innehåller förstås fler kategorier än så. Innan du genomför tester på många kategorier är det ofta bra att utföra en explorativ dataanalys (EDA) – beräkna sammanfattande statistik för varje grupp och visualisera fördelningarna av den numeriska variabeln för varje kategori med hjälp av lådagram.
Här återvänder vi till data om försenade leveranser och undersöker hur priset per paket (pack_price) varierar mellan de tre fraktsätten (shipment_mode): "Air", "Air Charter" och "Ocean".
late_shipments finns tillgängligt; pandas och matplotlib.pyplot är inlästa med sina standardalias, och seaborn är inläst som sns.
Den här övningen är en del av kursen
Hypotestestning i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Calculate the mean pack_price for each shipment_mode
xbar_pack_by_mode = ____
# Print the grouped means
print(xbar_pack_by_mode)