आपका पहला पाइपलाइन
आपके सहयोगी ने क्रेडिट स्कोरिंग डेटासेट के लिए AdaBoostClassifier का उपयोग किया है। आप एक रैंडम फॉरेस्ट क्लासिफायर भी आज़माना चाहते हैं। इस अभ्यास में, आप इस क्लासिफायर को डेटा पर फिट करेंगे और इसे AdaBoostClassifier से तुलना करेंगे। ओवरफिटिंग से बचने के लिए ट्रेन/टेस्ट डेटा स्प्लिटिंग का उपयोग ज़रूर करें। डेटा पहले से प्रीलोड और ट्रांसफॉर्म किया गया है ताकि सभी फीचर संख्यात्मक हों। फीचर X के रूप में और लेबल y के रूप में उपलब्ध हैं। मॉड्यूल RandomForestClassifier भी प्रीलोड है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में मशीन लर्निंग वर्कफ़्लो डिज़ाइन करना
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Split the data into train and test, with 20% as test
X_train, ____, ____, y_test = train_test_split(
X, y, ____=0.2, random_state=1)