본 데이터 vs. 미본 데이터
모델은 기존에 본 관측치에서는 더 높은 정확도를 보이는 경향이 있어요. 사탕 데이터셋에서 Skittles의 인기도를 예측하는 것이 Andes Mints의 인기도를 예측하는 것보다 정확도가 더 높을 가능성이 큽니다. Skittles는 데이터셋에 포함되어 있고, Andes Mints는 포함되어 있지 않기 때문이죠.
여러분은 50개의 사탕으로 구성된 X_train 데이터셋을 기반으로 모델을 만들었고, 모델이 학습에 사용된 50개 사탕의 인기도 예측과, 한 번도 보지 못한 35개 사탕(X_test)의 인기도 예측이 얼마나 정확한지 보고해야 합니다. 정확도 평가지표로 평균 절대 오차 mae()를 사용하세요.
이 연습은 강의의 일부입니다
Python에서의 모델 검증
연습 안내
- 입력 데이터로
X_train과X_test를 사용해model.predict()로 예측 배열을 만드세요. - 모델이 본 데이터와 한 번도 보지 못한 데이터 각각에 대한 모델 정확도를 계산하세요.
- 제공된 print 문을 사용해 본 데이터와 미본 데이터를 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# The model is fit using X_train and y_train
model.fit(X_train, y_train)
# Create vectors of predictions
train_predictions = model.predict(____)
test_predictions = model.predict(____)
# Train/Test Errors
train_error = mae(y_true=y_train, y_pred=____)
test_error = mae(y_true=y_test, y_pred=____)
# Print the accuracy for seen and unseen data
print("Model error on seen data: {0:.2f}.".format(____))
print("Model error on unseen data: {0:.2f}.".format(____))