क्रेडिट डेटा का One-hot encoding
अब non-numeric कॉलम्स को तैयार करने का समय है ताकि आप उन्हें अपने LogisticRegression() मॉडल में जोड़ सकें.
जब one-hot encoding से नए कॉलम्स बन जाएँ, तो आप उन्हें numeric कॉलम्स के साथ जोड़कर एक नया डेटा फ्रेम बना सकते हैं, जिसे कोर्स के बाकी हिस्से में probability of default की भविष्यवाणी करने के लिए उपयोग किया जाएगा.
याद रखें, केवल non-numeric कॉलम्स पर ही one-hot encode करें. यदि आप numeric कॉलम्स पर ऐसा करेंगे, तो डेटा सेट बहुत ही ज्यादा चौड़ा हो जाएगा!
क्रेडिट लोन डेटा cr_loan_clean पहले से ही वर्कस्पेस में लोड है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में क्रेडिट रिस्क मॉडलिंग
अभ्यास निर्देश
- सभी numeric कॉलम्स के लिए
cred_numनाम का डेटा सेट बनाएँ और non-numeric कॉलम्स के लिएcred_strनाम का एक और डेटा सेट बनाएँ. cred_strपर one-hot encoding लागू करकेcred_str_onehotनाम का नया डेटा सेट बनाएँ.cred_numको नए one-hot encoded डेटा के साथ union करें और परिणामcr_loan_prepके रूप में सहेजें.- नए डेटा सेट के कॉलम्स प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])
# One-hot encode the non-numeric columns
____ = pd.____(____)
# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)
# Print the columns in the new data set
print(____.columns)