or
यह अभ्यास पाठ्यक्रम का हिस्सा है
इस अध्याय में, आप जानेंगे कि फीचर इंजीनियरिंग क्या है और इसे वास्तविक दुनिया के डेटा पर कैसे शुरू करें। आप एक सर्वे रिस्पॉन्स डेटासेट को लोड, एक्सप्लोर और विज़ुअलाइज़ करेंगे, और ऐसा करते हुए इसके आधारभूत डेटा टाइप्स के बारे में सीखेंगे और क्यों वे इस बात को प्रभावित करते हैं कि आपको अपने फीचर्स कैसे इंजीनियर करने चाहिए। pandas पैकेज का उपयोग करके आप श्रेणीबद्ध और सतत दोनों तरह के कॉलम से नए फीचर्स बनाएँगे।
यह अध्याय आपको गंदे और अधूरे डेटा की हकीकत से परिचित कराता है। आप सीखेंगे कि आपके डेटा में मिसिंग वैल्यूज़ कहाँ हैं और उनसे निपटने के कई तरीकों का पता लगाएंगे। आप अपने डेटासेट में अनचाहे कैरेक्टर्स से निपटने के लिए स्ट्रिंग मैनीपुलेशन तकनीकों का भी उपयोग करेंगे।
इस अध्याय में, आप अपने डेटा के आधारभूत वितरण का विश्लेषण करने पर ध्यान देंगे और यह समझेंगे कि क्या यह आपकी मशीन लर्निंग पाइपलाइन को प्रभावित करेगा। आप टेढ़े (skewed) डेटा से निपटने और उन स्थितियों को संभालने के तरीके सीखेंगे जहाँ आउट्लायर्स आपके विश्लेषण पर नकारात्मक असर डाल सकते हैं।
अंत में, इस अध्याय में आप असंरचित टेक्स्ट डेटा के साथ काम करेंगे और समझेंगे कि किसी टेक्स्ट कॉर्पस से कॉलमनुमा फीचर्स कैसे इंजीनियर किए जा सकते हैं। आप तुलना करेंगे कि अलग‑अलग तरीकों का असर इस पर कैसे पड़ता है कि टेक्स्ट से कितना संदर्भ निकाला जा रहा है, और बहुत अधिक फीचर्स बनाए बिना संदर्भ की ज़रूरत को कैसे संतुलित करें।
वर्तमान अभ्यास