Train - test split
इस अध्याय में, आप ANSUR डेटासेट के साथ काम जारी रखेंगे. अपने डेटासेट पर मॉडल बनाने से पहले, आपको तय करना होगा कि आप किस फीचर की भविष्यवाणी करना चाहते हैं. इस मामले में, आप gender की भविष्यवाणी करने की कोशिश कर रहे हैं.
आपको इस फीचर वाला कॉलम डेटासेट से निकालना है और फिर डेटा को training और test सेट में बाँटना है. training सेट मॉडल को ट्रेन करने के लिए उपयोग होगा और test सेट अनदेखे डेटा पर उसके प्रदर्शन की जाँच के लिए.
ansur_df आपके लिए पहले से लोड किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Dimensionality Reduction
अभ्यास निर्देश
sklearn.model_selectionसेtrain_test_splitफंक्शन इम्पोर्ट करें.'Gender'कॉलम को y में असाइन करें.- DataFrame से
'Gender'कॉलम हटा कर परिणाम कोXमें असाइन करें. - टेस्ट साइज़ 30% सेट करें ताकि 70% ट्रेन और 30% टेस्ट डेटा स्प्लिट किया जा सके.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import train_test_split()
from ____.____ import ____
# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]
# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)
# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)
print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")