Seen बनाम unseen डेटा
मॉडल आम तौर पर उन ऑब्ज़र्वेशंस पर अधिक सटीकता दिखाते हैं जिन्हें वे पहले देख चुके होते हैं. कैंडी डेटासेट में, Skittles की लोकप्रियता की भविष्यवाणी करना, Andes Mints की तुलना में, अधिक सटीक होने की संभावना है; Skittles डेटासेट में है, और Andes Mints नहीं है.
आपने 50 कैंडीज़ पर आधारित एक मॉडल X_train डेटासेट से बनाया है और आपको रिपोर्ट करना है कि मॉडल उन 50 कैंडीज़ की लोकप्रियता के लिए, जिन पर मॉडल बनाया गया था, और उन 35 कैंडीज़ (X_test) के लिए, जिन्हें उसने कभी नहीं देखा, कितनी सटीक भविष्यवाणी करता है. आप सटीकता मीट्रिक के रूप में mean absolute error mae() का उपयोग करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Model Validation
अभ्यास निर्देश
- इनपुट डेटा के रूप में
X_trainऔरX_testका उपयोग करते हुए,model.predict()से प्रेडिक्शंस की arrays बनाइए. - उस डेटा पर मॉडल की सटीकता निकालिए जिसे मॉडल ने देखा है और उस डेटा पर भी जिसे उसने पहले नहीं देखा है.
- seen और unseen डेटा को प्रिंट करने के लिए दिए गए print स्टेटमेंट्स का उपयोग करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# The model is fit using X_train and y_train
model.fit(X_train, y_train)
# Create vectors of predictions
train_predictions = model.predict(____)
test_predictions = model.predict(____)
# Train/Test Errors
train_error = mae(y_true=y_train, y_pred=____)
test_error = mae(y_true=y_test, y_pred=____)
# Print the accuracy for seen and unseen data
print("Model error on seen data: {0:.2f}.".format(____))
print("Model error on unseen data: {0:.2f}.".format(____))