Variantie en standaarddeviatie
Variantie en standaarddeviatie zijn twee van de meest gebruikte maten voor de spreiding van een variabele. In deze oefening ga je ze berekenen. Spreiding is belangrijk omdat het helpt verwachtingen te vormen. Stel dat een verkoopmedewerker gemiddeld 20 producten per dag verkoopt, maar met een standaarddeviatie van 10 producten. Dan zijn er waarschijnlijk dagen waarop ze 40 producten verkopen, maar ook dagen met slechts één of twee. Zulke informatie is belangrijk, vooral bij het maken van voorspellingen.
pandas is geïmporteerd als pd, numpy als np en matplotlib.pyplot als plt; de DataFrame food_consumption is ook beschikbaar.
Deze oefening maakt deel uit van de cursus
Inleiding tot statistiek in Python
Oefeninstructies
- Bereken de variantie en standaarddeviatie van
co2_emissionvoor elkefood_categorymet de methodes.groupby()en.agg(); vergelijk de waarden van variantie en standaarddeviatie. - Maak een histogram van
co2_emissionvoor debeefinfood_categoryen toon de plot. - Maak een histogram van
co2_emissionvoor deeggsinfood_categoryen toon de plot.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Print variance and sd of co2_emission for each food_category
print(food_consumption.____('____')['____'].agg([____]))
# Create histogram of co2_emission for food_category 'beef'
food_consumption[____]['____'].____()
plt.show()
# Create histogram of co2_emission for food_category 'eggs'
plt.figure()
food_consumption[____]['____'].____()
plt.show()