Churn रेट की जाँच करें और डेटा स्प्लिट करें
Chapter 1 में जो ओवरव्यू आपने देखा था, उसके आधार पर इस लेसन में आप मशीन लर्निंग से churn prediction करने के लिए ज़रूरी data preparation में गहराई से जाएँगे। आप churn distribution को एक्सप्लोर करेंगे और मॉडलिंग से पहले डेटा को training और testing में बाँटेंगे। इस स्टेप में आप समझेंगे कि churn rate कैसे वितरित है, और डेटा को प्री-प्रोसेस करेंगे ताकि आप training सेट पर मॉडल बना सकें और unused testing डेटा पर उसका performance माप सकें.
टेलीकॉम डेटासेट pandas DataFrame के रूप में telcom नाम से लोड किया गया है। टार्गेट वैरिएबल कॉलम का नाम Churn है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में मार्केटिंग के लिए मशीन लर्निंग
अभ्यास निर्देश
Churnकॉलम में मौजूद unique values प्रिंट करें.- प्रत्येक churn समूह का ratio size कैलकुलेट करें.
- डेटा को train और test में बाँटने वाले फंक्शन को इम्पोर्ट करें.
- डेटा को 75% train और 25% test में स्प्लिट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Print the unique Churn values
print(___(telcom['Churn']))
# Calculate the ratio size of each churn group
telcom.___(['Churn']).size() / telcom.shape[0] * 100
# Import the function for splitting data to train and test
from sklearn.model_selection import ___
# Split the data into train and test
train, test = ___(telcom, test_size = .25)