शुरू करेंमुफ़्त में शुरू करें

आदर्श डेटासेट चुनना

अब ufo डेटासेट में कुछ अनावश्यक फीचर्स हटाते हैं। क्योंकि country कॉलम को country_enc के रूप में एन्कोड किया जा चुका है, आप इसे रख सकते हैं और लोकेशन से जुड़ी बाकी कॉलम्स ड्रॉप कर सकते हैं: city, country, lat, long, और state.

आपने month और year कॉलम्स इंजीनियर कर लिए हैं, इसलिए अब date और recorded कॉलम्स की ज़रूरत नहीं है। आपने seconds कॉलम को seconds_log के रूप में स्टैंडर्डाइज़ भी किया है, इसलिए आप seconds और minutes को ड्रॉप कर सकते हैं.

आपने desc को वेक्टराइज़ कर लिया है, इसलिए इसे हटाया जा सकता है। अभी के लिए आप type को रखेंगे।

आप length_of_time कॉलम भी हटा सकते हैं, क्योंकि minutes निकाल लेने के बाद यह ज़रूरी नहीं रह गया है।

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Machine Learning के लिए Preprocessing

पाठ्यक्रम देखें

अभ्यास निर्देश

  • ड्रॉप करने के लिए सभी कॉलम्स की एक सूची to_drop बनाइए।
  • ufo से ये कॉलम्स ड्रॉप कीजिए।
  • पहले बनाई गई words_to_filter() फंक्शन का उपयोग कीजिए; इसमें vocab, vec.vocabulary_, desc_tfidf पास करें, और अंतिम पैरामीटर में टॉप 4 शब्द रखिए।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Make a list of features to drop
to_drop = [____]

# Drop those features
ufo_dropped = ufo.____

# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)
कोड संपादित करें और चलाएँ