टेक्स्ट वेक्टर की पड़ताल, भाग 2
पिछले अभ्यास में लिखे गए return_weights() फंक्शन का उपयोग करते हुए, अब आप टेक्स्ट वेक्टर के प्रत्येक डॉक्युमेंट से शीर्ष शब्द निकालेंगे, शब्द इंडेक्सों की एक सूची लौटाएँगे, और उस सूची का उपयोग करके टेक्स्ट वेक्टर को केवल उन्हीं शीर्ष शब्दों तक फ़िल्टर करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Machine Learning के लिए Preprocessing
अभ्यास निर्देश
- उस डॉक्युमेंट के लिए शीर्ष वेटेड शब्द लौटाने हेतु
return_weights()कॉल करें. - डुप्लीकेट नंबर हटाने के लिए लौटे हुए
filter_listपरset()कॉल करें. words_to_filterकॉल करें, और ये पैरामीटर पास करें:vocabकोvocabपैरामीटर में,tfidf_vec.vocabulary_कोoriginal_vocabपैरामीटर में,text_tfidfकोvectorपैरामीटर में, और3ताकि प्रत्येक डॉक्युमेंट सेtop_nके 3 सबसे वेटेड शब्द लिए जाएँ.- अंत में, उस
filtered_wordsसेट को एक सूची में बदलकर टेक्स्ट वेक्टर के लिए फ़िल्टर के तौर पर पास करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
def words_to_filter(vocab, original_vocab, vector, top_n):
filter_list = []
for i in range(0, vector.shape[0]):
# Call the return_weights function and extend filter_list
filtered = ____(vocab, original_vocab, vector, i, top_n)
filter_list.extend(filtered)
# Return the list in a set, so we don't get duplicate word indices
return ____(filter_list)
# Call the function to get the list of word indices
filtered_words = ____(____, ____, ____, ____)
# Filter the columns in text_tfidf to only those in filtered_words
filtered_text = text_tfidf[:, list(____)]