कर्मचारी डेटा स्प्लिट करना
डेटासेट को ओवरफिट करना एनालिटिक्स में एक आम समस्या है। ऐसा तब होता है जब कोई मॉडल उसी डेटासेट पर तो अच्छा काम करता है जिस पर उसे विकसित किया गया था, लेकिन उसके बाहर जनरलाइज़ नहीं कर पाता।
मॉडल को जनरलाइज़ करने के लिए train/test स्प्लिट किया जाता है: आप मॉडल को training सैंपल पर विकसित करते हैं और बाद में उसे test सैंपल पर आज़माते हैं।
इस अभ्यास में, आप target और features — दोनों को 75%/25% अनुपात में क्रमशः train और test सेट में स्प्लिट करेंगे।
यह अभ्यास पाठ्यक्रम का हिस्सा है
HR Analytics: Python में कर्मचारी churn की भविष्यवाणी
अभ्यास निर्देश
sklearn.model_selectionमॉड्यूल सेtrain_test_splitइम्पोर्ट करें- अपने डेटासेट को training और testing सेट में स्प्लिट करने के लिए
train_test_split()का उपयोग करें - अपनी 25% observations को testing सेट को असाइन करें
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____
# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)