잔차 분석하기
선형 모델을 구현하려면 예측값과 실제 데이터 사이의 거리인 잔차(residual) 를 살펴봐야 합니다.
다음 세 가지 조건을 만족해야 합니다:
- 평균이 0이어야 합니다.
- 분산이 일정해야 합니다.
- 분포가 정규분포를 따라야 합니다.
같은 과목에 대한 두 학교 A와 B의 시험 점수 데이터를 사용하겠습니다. 각각 hours_of_study_A 와 test_scores_A, hours_of_study_B 와 test_scores_B 로 model_A 와 model_B 를 적합해 두었습니다.
matplotlib.pyplot 은 plt 로, numpy 는 np 로, 그리고 sklearn.linear_model 에서 LinearRegression 이(가) 이미 임포트되어 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 확률 기초
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Scatterplot of hours of study and test scores
plt.scatter(____, ____)
# Plot of hours_of_study_values_A and predicted values
plt.plot(____, model_A.____(hours_of_study_values_A))
plt.title("Model A", fontsize=25)
plt.show()