शुरू करेंमुफ़्त में शुरू करें

टेक्स्ट वेक्टर की पड़ताल, भाग 2

पिछले अभ्यास में लिखे गए return_weights() फंक्शन का उपयोग करते हुए, अब आप टेक्स्ट वेक्टर के प्रत्येक डॉक्युमेंट से शीर्ष शब्द निकालेंगे, शब्द इंडेक्सों की एक सूची लौटाएँगे, और उस सूची का उपयोग करके टेक्स्ट वेक्टर को केवल उन्हीं शीर्ष शब्दों तक फ़िल्टर करेंगे.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Machine Learning के लिए Preprocessing

पाठ्यक्रम देखें

अभ्यास निर्देश

  • उस डॉक्युमेंट के लिए शीर्ष वेटेड शब्द लौटाने हेतु return_weights() कॉल करें.
  • डुप्लीकेट नंबर हटाने के लिए लौटे हुए filter_list पर set() कॉल करें.
  • words_to_filter कॉल करें, और ये पैरामीटर पास करें: vocab को vocab पैरामीटर में, tfidf_vec.vocabulary_ को original_vocab पैरामीटर में, text_tfidf को vector पैरामीटर में, और 3 ताकि प्रत्येक डॉक्युमेंट से top_n के 3 सबसे वेटेड शब्द लिए जाएँ.
  • अंत में, उस filtered_words सेट को एक सूची में बदलकर टेक्स्ट वेक्टर के लिए फ़िल्टर के तौर पर पास करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

def words_to_filter(vocab, original_vocab, vector, top_n):
    filter_list = []
    for i in range(0, vector.shape[0]):
    
        # Call the return_weights function and extend filter_list
        filtered = ____(vocab, original_vocab, vector, i, top_n)
        filter_list.extend(filtered)
        
    # Return the list in a set, so we don't get duplicate word indices
    return ____(filter_list)

# Call the function to get the list of word indices
filtered_words = ____(____, ____, ____, ____)

# Filter the columns in text_tfidf to only those in filtered_words
filtered_text = text_tfidf[:, list(____)]
कोड संपादित करें और चलाएँ