Breast cancer के लिए लॉजिस्टिक रिग्रेशन
पिछले अभ्यास में, हमने डेटा का प्रारंभिक मूल्यांकन किया था। इस अभ्यास में, आप breast cancer डेटासेट पर एक लॉजिस्टिक रिग्रेशन मॉडल के लिए training और testing split परिभाषित करेंगे। यह किसी भी मशीन लर्निंग मॉडल को चलाने का पहला महत्वपूर्ण कदम है.
Breast cancer डेटासेट sklearn का एक sample डेटासेट है जिसमें रोगियों से जुड़े कई फीचर हैं, और एक target वैल्यू होती है जो बताती है कि रोगी को breast cancer है या नहीं। डेटा डिक्शनरी फॉर्मेट में आता है, जहाँ मुख्य डेटा data नाम की array में होता है और target वैल्यूज़ target नाम की array में। इसलिए, cancer_data.data फीचर होंगे और cancer_data.target targets होंगे। Sample डेटा cancer_data के रूप में लोड है और pandas pd के रूप में उपलब्ध है। LogisticRegression को sklearn.linear_model के माध्यम से एक्सेस किया जा सकता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Machine Learning के साथ CTR प्रेडिक्शन
अभ्यास निर्देश
- क्रमशः
dataऔरtargetका उपयोग करकेXऔरyपरिभाषित करें. X_trainऔरy_trainको क्रमशःXऔरyके पहले 300 सैंपल बनाएँ, जहाँX_trainके लिएX[:300]उपयोग करें.X_testऔरy_testको क्रमशःXऔरyके शेष भाग से बनाएँ (पहले 300 सैंपल छोड़कर), जहाँX_testके लिएX[300:]उपयोग करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Define X and y
X = cancer_data.____
y = cancer_data.____
# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____]