टेक्स्ट वेक्टर की खोज, भाग 1
आइए अभी सीखी गई टेक्स्ट वेक्टर एक्सप्लोरेशन विधि को volunteer डेटासेट के title tf/idf वेक्टर पर आगे बढ़ाएँ। टेक्स्ट वेक्टर एक्सप्लोरेशन के इस पहले भाग में, हम स्लाइड्स में देखे गए उस फंक्शन में थोड़ा और जोड़ेंगे। यह फंक्शन नंबरों की एक लिस्ट लौटाएगा। अगले अभ्यास में, हम एक और फंक्शन लिखेंगे जो सभी डॉक्यूमेंट्स के सबसे महत्वपूर्ण शब्द इकट्ठा करेगा, उन्हें निकालेगा, और फिर उस लिस्ट का उपयोग करके अपने text_tfidf वेक्टर को फिल्टर करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Machine Learning के लिए Preprocessing
अभ्यास निर्देश
original_vocabनाम का पैरामीटर जोड़ें, जोtfidf_vec.vocabulary_के लिए होगा, औरtop_nभी जोड़ें.- ज़िप किए गए डिक्शनरी पर
pd.Series()कॉल करें। इससे उस पर ऑपरेशन करना आसान होगा. - सीरीज़ को
.sort_values()फंक्शन से सॉर्ट करें और इंडेक्स कोtop_nशब्दों तक स्लाइस करें. - फंक्शन कॉल करें, जहाँ
original_vocab=tfidf_vec.vocabulary_सेट करें,vector_index=8सेट करें ताकि 9वीं पंक्ति मिले, औरtop_n=3सेट करें, ताकि शीर्ष 3 वेटेड शब्द मिलें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Add in the rest of the arguments
def return_weights(vocab, ____, vector, vector_index, ____):
zipped = dict(zip(vector[vector_index].indices, vector[vector_index].data))
# Transform that zipped dict into a series
zipped_series = ____({vocab[i]:zipped[i] for i in vector[vector_index].indices})
# Sort the series to pull out the top n weighted words
zipped_index = zipped_series.____(ascending=False)[:____].index
return [original_vocab[i] for i in zipped_index]
# Print out the weighted words
print(return_weights(vocab, ____, text_tfidf, ____, ____))