खास कॉलमों का One-hot encoding
एक स्थानीय इस्तेमाल की गई कारों का डीलरशिप आपसे अपने वाहनों की बिक्री कीमत का अनुमान लगाने में मदद चाहता है। अगर आप पूरे used_cars डेटासेट पर one-hot encoding लगाते हैं, तो नए डेटासेट में 1,200 से ज़्यादा कॉलम बन जाते हैं। आपको चिंता है कि कीमत की भविष्यवाणी के लिए मशीन लर्निंग मॉडल ट्रेन करते समय यह समस्या पैदा कर सकता है। आपने एक सरल तरीका अपनाने का फैसला किया है और केवल चंद कॉलमों पर ही one-hot encoding लगानी है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Categorical Data के साथ काम करना
अभ्यास निर्देश
- एक नया डेटासेट
used_cars_simpleबनाएँ, जिसमें इन कॉलमों के लिए one-hot encoding हो:"manufacturer_name"और"transmission"(इसी क्रम में). - सभी नए कॉलम का प्रीफ़िक्स
"dummy"रखें, ताकि आप नए बनाए गए कॉलम को आसानी से फ़िल्टर कर सकें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create one-hot encoding for just two columns
used_cars_simple = pd.____(
used_cars,
# Specify the columns from the instructions
____,
# Set the prefix
____
)
# Print the shape of the new dataset
print(used_cars_simple.shape)