शुरू करेंमुफ़्त में शुरू करें

क्रेडिट डेटा का One-hot encoding

अब non-numeric कॉलम्स को तैयार करने का समय है ताकि आप उन्हें अपने LogisticRegression() मॉडल में जोड़ सकें.

जब one-hot encoding से नए कॉलम्स बन जाएँ, तो आप उन्हें numeric कॉलम्स के साथ जोड़कर एक नया डेटा फ्रेम बना सकते हैं, जिसे कोर्स के बाकी हिस्से में probability of default की भविष्यवाणी करने के लिए उपयोग किया जाएगा.

याद रखें, केवल non-numeric कॉलम्स पर ही one-hot encode करें. यदि आप numeric कॉलम्स पर ऐसा करेंगे, तो डेटा सेट बहुत ही ज्यादा चौड़ा हो जाएगा!

क्रेडिट लोन डेटा cr_loan_clean पहले से ही वर्कस्पेस में लोड है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में क्रेडिट रिस्क मॉडलिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • सभी numeric कॉलम्स के लिए cred_num नाम का डेटा सेट बनाएँ और non-numeric कॉलम्स के लिए cred_str नाम का एक और डेटा सेट बनाएँ.
  • cred_str पर one-hot encoding लागू करके cred_str_onehot नाम का नया डेटा सेट बनाएँ.
  • cred_num को नए one-hot encoded डेटा के साथ union करें और परिणाम cr_loan_prep के रूप में सहेजें.
  • नए डेटा सेट के कॉलम्स प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])

# One-hot encode the non-numeric columns
____ = pd.____(____)

# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)

# Print the columns in the new data set
print(____.columns)
कोड संपादित करें और चलाएँ