시작하기무료로 시작하기

분산과 표준편차

분산과 표준편차는 변수의 산포를 측정하는 가장 일반적인 방법 중 두 가지이며, 이번 연습 문제에서는 이를 계산하는 연습을 해 보겠습니다. 산포는 어떤 결과를 기대할 수 있는지 가늠하는 데 도움이 되기 때문에 중요합니다. 예를 들어, 어떤 영업사원이 하루 평균 20개의 제품을 판매하지만 표준편차가 10개라면, 40개를 판매하는 날도 있겠지만 1~2개만 판매하는 날도 있을 것입니다. 이와 같은 정보는 특히 예측을 할 때 중요합니다.

pandaspd로, numpynp로, matplotlib.pyplotplt로 임포트되어 있으며, food_consumption DataFrame도 사용할 수 있습니다.

이 연습은 강의의 일부입니다

Python으로 시작하는 통계학

강의 보기

연습 안내

  • .groupby().agg() 메서드를 사용해 각 food_categoryco2_emission 분산과 표준편차를 계산하고 두 값을 비교해 보세요.
  • food_categorybeef인 행의 co2_emission의 히스토그램을 만들고 그래프를 표시하세요.
  • food_categoryeggs인 행의 co2_emission의 히스토그램을 만들고 그래프를 표시하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Print variance and sd of co2_emission for each food_category
print(food_consumption.____('____')['____'].agg([____]))

# Create histogram of co2_emission for food_category 'beef'
food_consumption[____]['____'].____()
plt.show()

# Create histogram of co2_emission for food_category 'eggs'
plt.figure()
food_consumption[____]['____'].____()
plt.show()
코드 편집 및 실행