Sedd kontra osedd data
Modeller tenderar att ha högre noggrannhet på observationer de redan har sett. I godisdatamängden är det troligtvis enklare att förutsäga populariteten hos Skittles än hos Andes Mints – Skittles finns i datamängden, men inte Andes Mints.
Du har byggt en modell baserad på 50 godisbitar med datamängden X_train och behöver rapportera hur träffsäker modellen är när det gäller att förutsäga populariteten hos de 50 godisbitar den tränats på, samt de 35 godisbitar (X_test) den aldrig har sett. Du använder medelabsolutfelet, mae(), som noggrannhetsmått.
Den här övningen är en del av kursen
Modellvalidering i Python
Övningsinstruktioner
- Skapa arrayer med förutsägelser med hjälp av
model.predict()ochX_trainrespektiveX_testsom indata. - Beräkna modellens noggrannhet både på data som modellen har sett och på data den inte har sett tidigare.
- Använd print-satserna för att skriva ut resultaten för sedd och osedd data.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# The model is fit using X_train and y_train
model.fit(X_train, y_train)
# Create vectors of predictions
train_predictions = model.predict(____)
test_predictions = model.predict(____)
# Train/Test Errors
train_error = mae(y_true=y_train, y_pred=____)
test_error = mae(y_true=y_test, y_pred=____)
# Print the accuracy for seen and unseen data
print("Model error on seen data: {0:.2f}.".format(____))
print("Model error on unseen data: {0:.2f}.".format(____))