시간에 따른 모델 점수 변동 시각화
각 계수의 변동성을 확인했으니, 이번에는 모델의 성능(점수)도 같은 방식으로 살펴보겠습니다. TimeSeriesSplit 객체는 각 테스트 세트에 대해 점점 더 나중의 인덱스를 사용합니다. 따라서 검증에서 얻은 점수들을 하나의 시계열로 간주할 수 있어요. 이를 시간에 따라 시각화하면 모델 성능이 시간에 따라 어떻게 변하는지 확인할 수 있습니다.
Linear regression 모델 인스턴스는 model에, 교차 검증 객체는 cv에, 데이터는 X와 y에 저장되어 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 시계열 데이터 Machine Learning
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
from sklearn.model_selection import cross_val_score
# Generate scores for each split to see how the model performs over time
scores = cross_val_score(model, X, y, cv=cv, scoring=my_pearsonr)
# Convert to a Pandas Series object
scores_series = pd.Series(scores, index=times_scores, name='score')
# Bootstrap a rolling confidence interval for the mean score
scores_lo = scores_series.____(20).aggregate(partial(____, percentiles=2.5))
scores_hi = scores_series.____(20).aggregate(partial(____, percentiles=97.5))