ट्रेन और टेस्टिंग ट्रांसफ़ॉर्मेशंस (I)
अब तक आपने किसी एक कॉलम पर आधारित स्केलर बनाए हैं और फिर उसी डेटा पर स्केलर लगाया है जिस पर उसे ट्रेन किया गया था। मशीन लर्निंग मॉडल बनाते समय आप आम तौर पर अपने मॉडल को ऐतिहासिक डेटा (train set) पर बनाते हैं और फिर उसे नए, पहले न देखे गए डेटा (test set) पर लागू करते हैं। ऐसे में ज़रूरी है कि ट्रेनिंग और टेस्ट दोनों डेटा पर बिल्कुल वही स्केलिंग लागू हो।
व्यवहार में ऐसा करने के लिए आप स्केलर को train set पर ट्रेन करते हैं और उसी प्रशिक्षित स्केलर को test set पर लागू करते हैं। आपको कभी भी test set पर स्केलर को दोबारा ट्रेन नहीं करना चाहिए.
इस अभ्यास और अगले वाले के लिए, हमने so_numeric_df DataFrame को train (so_train_numeric) और test (so_test_numeric) सेट्स में बाँटा है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में मशीन लर्निंग के लिए फीचर इंजीनियरिंग
अभ्यास निर्देश
StandardScaler()कोSS_scalerनाम से इंस्टैंशिएट करें।Ageकॉलम परStandardScalerको फिट करें।- test set (
so_test_numeric) मेंAgeकॉलम को ट्रांसफ़ॉर्म करें।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import StandardScaler
from sklearn.preprocessing import StandardScaler
# Apply a standard scaler to the data
SS_scaler = ____
# Fit the standard scaler to the data
____
# Transform the test data using the fitted scaler
so_test_numeric['Age_ss'] = ____
print(so_test_numeric[['Age', 'Age_ss']].head())