Date văzute vs. date nevăzute
Modelele tind să aibă o acuratețe mai mare pentru observațiile pe care le-au mai văzut. În setul de date despre bomboane, predicția popularității pentru Skittles va fi probabil mai precisă decât pentru Andes Mints; Skittles se află în set, iar Andes Mints nu.
Ai construit un model pe baza a 50 de bomboane, folosind setul de date X_train, și trebuie să raportezi cât de precis este modelul atunci când prezice popularitatea celor 50 de bomboane pe care le-a văzut în antrenament, respectiv a celor 35 de bomboane (X_test) pe care nu le-a mai întâlnit. Vei folosi eroarea absolută medie, mae(), ca metrică de acuratețe.
Acest exercițiu face parte din cursul
Validarea modelelor în Python
Instrucțiuni pentru exercițiu
- Folosind
X_trainșiX_testca date de intrare, creează tablouri de predicții cumodel.predict(). - Calculează acuratețea modelului atât pe datele pe care le-a văzut, cât și pe datele pe care nu le-a văzut înainte.
- Folosește instrucțiunile
printpentru a afișa rezultatele pentru datele văzute și cele nevăzute.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# The model is fit using X_train and y_train
model.fit(X_train, y_train)
# Create vectors of predictions
train_predictions = model.predict(____)
test_predictions = model.predict(____)
# Train/Test Errors
train_error = mae(y_true=y_train, y_pred=____)
test_error = mae(y_true=y_test, y_pred=____)
# Print the accuracy for seen and unseen data
print("Model error on seen data: {0:.2f}.".format(____))
print("Model error on unseen data: {0:.2f}.".format(____))