रिग्रेशन के लिए सेंटरिंग और स्केलिंग
अब जब आपने अपने डेटा को स्केल करने के फायदे देख लिए हैं, तो आप एक pipeline का उपयोग करके music_df की फीचर्स को प्रीप्रोसेस करेंगे और एक lasso regression मॉडल बनाएँगे ताकि किसी गाने की loudness का अनुमान लगाया जा सके.
X_train, X_test, y_train, और y_test को music_df डेटासेट से बनाया गया है, जहाँ target "loudness" है और फीचर्स डेटासेट के बाकी सभी कॉलम हैं. आपके लिए Lasso और Pipeline भी import किए गए हैं.
ध्यान दें कि "genre" को एक बाइनरी फीचर में बदला गया है, जहाँ 1 rock गाने को दर्शाता है और 0 अन्य genres को.
यह अभ्यास पाठ्यक्रम का हिस्सा है
scikit-learn के साथ Supervised Learning
अभ्यास निर्देश
StandardScalerimport करें.- pipeline ऑब्जेक्ट के लिए steps बनाएँ: एक
"scaler"नाम काStandardScalerऑब्जेक्ट, औरalpha0.5के साथ"lasso"नाम का lasso मॉडल. - स्केल करने और lasso regression मॉडल बनाने के steps के साथ एक pipeline instantiate करें.
- test डेटा पर R-squared वैल्यू की गणना करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import StandardScaler
____
# Create pipeline steps
steps = [("____", ____()),
("____", ____(alpha=____))]
# Instantiate the pipeline
pipeline = ____(____)
pipeline.fit(X_train, y_train)
# Calculate and print R-squared
print(____.____(____, ____))