दो होल्डआउट सेट बनाएँ
आपने हाल ही में अपनी बॉस के लिए Tic-Tac-Toe गेम की जीतें प्रेडिक्ट करने हेतु एक साधारण रैंडम फॉरेस्ट मॉडल बनाया था, और उनकी रिक्वेस्ट पर आपने कोई पैरामीटर ट्यूनिंग नहीं की थी. दुर्भाग्य से, मॉडल की कुल सटीकता उनके मानकों के हिसाब से बहुत कम रही. इस बार, उन्होंने आपसे मॉडल परफॉर्मेंस पर ध्यान केंद्रित करने को कहा है.
विभिन्न मॉडल और पैरामीटर सेट आज़माने से पहले, आपको डेटा को training, validation, और testing डेटासेट में बाँटना होगा. याद रखें कि डेटा को training और testing डेटासेट में बाँटने के बाद, validation डेटासेट training डेटासेट को और बाँटकर बनाया जाता है.
डेटासेट X और y आपके उपयोग के लिए लोड कर दिए गए हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Model Validation
अभ्यास निर्देश
- टेम्पररी डेटासेट और testing डेटासेट (
X_test,y_test) बनाएँ. testing डेटासेट के लिए कुल डेटा का 20% उपयोग करें. - टेम्पररी डेटासेट (
X_temp,y_temp) का उपयोग करके training (X_train,y_train) और validation (X_val,y_val) डेटासेट बनाएँ. - validation डेटासेट के लिए टेम्पररी डेटा का 25% उपयोग करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create temporary training and final testing datasets
X_temp, ____, y_temp, ____ =\
train_test_split(X, y, ____=____, random_state=1111)
# Create the final training and validation datasets
____, ____, ____, ____ =\
train_test_split(X_temp, y_temp, ____=____, random_state=1111)