आदर्श डेटासेट चुनना
अब ufo डेटासेट में कुछ अनावश्यक फीचर्स हटाते हैं। क्योंकि country कॉलम को country_enc के रूप में एन्कोड किया जा चुका है, आप इसे रख सकते हैं और लोकेशन से जुड़ी बाकी कॉलम्स ड्रॉप कर सकते हैं: city, country, lat, long, और state.
आपने month और year कॉलम्स इंजीनियर कर लिए हैं, इसलिए अब date और recorded कॉलम्स की ज़रूरत नहीं है। आपने seconds कॉलम को seconds_log के रूप में स्टैंडर्डाइज़ भी किया है, इसलिए आप seconds और minutes को ड्रॉप कर सकते हैं.
आपने desc को वेक्टराइज़ कर लिया है, इसलिए इसे हटाया जा सकता है। अभी के लिए आप type को रखेंगे।
आप length_of_time कॉलम भी हटा सकते हैं, क्योंकि minutes निकाल लेने के बाद यह ज़रूरी नहीं रह गया है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Machine Learning के लिए Preprocessing
अभ्यास निर्देश
- ड्रॉप करने के लिए सभी कॉलम्स की एक सूची
to_dropबनाइए। ufoसे ये कॉलम्स ड्रॉप कीजिए।- पहले बनाई गई
words_to_filter()फंक्शन का उपयोग कीजिए; इसमेंvocab,vec.vocabulary_,desc_tfidfपास करें, और अंतिम पैरामीटर में टॉप4शब्द रखिए।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Make a list of features to drop
to_drop = [____]
# Drop those features
ufo_dropped = ufo.____
# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)