शुरू करेंमुफ़्त में शुरू करें

टेक्स्ट वेक्टर की खोज, भाग 1

आइए अभी सीखी गई टेक्स्ट वेक्टर एक्सप्लोरेशन विधि को volunteer डेटासेट के title tf/idf वेक्टर पर आगे बढ़ाएँ। टेक्स्ट वेक्टर एक्सप्लोरेशन के इस पहले भाग में, हम स्लाइड्स में देखे गए उस फंक्शन में थोड़ा और जोड़ेंगे। यह फंक्शन नंबरों की एक लिस्ट लौटाएगा। अगले अभ्यास में, हम एक और फंक्शन लिखेंगे जो सभी डॉक्यूमेंट्स के सबसे महत्वपूर्ण शब्द इकट्ठा करेगा, उन्हें निकालेगा, और फिर उस लिस्ट का उपयोग करके अपने text_tfidf वेक्टर को फिल्टर करेंगे.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Machine Learning के लिए Preprocessing

पाठ्यक्रम देखें

अभ्यास निर्देश

  • original_vocab नाम का पैरामीटर जोड़ें, जो tfidf_vec.vocabulary_ के लिए होगा, और top_n भी जोड़ें.
  • ज़िप किए गए डिक्शनरी पर pd.Series() कॉल करें। इससे उस पर ऑपरेशन करना आसान होगा.
  • सीरीज़ को .sort_values() फंक्शन से सॉर्ट करें और इंडेक्स को top_n शब्दों तक स्लाइस करें.
  • फंक्शन कॉल करें, जहाँ original_vocab=tfidf_vec.vocabulary_ सेट करें, vector_index=8 सेट करें ताकि 9वीं पंक्ति मिले, और top_n=3 सेट करें, ताकि शीर्ष 3 वेटेड शब्द मिलें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Add in the rest of the arguments
def return_weights(vocab, ____, vector, vector_index, ____):
    zipped = dict(zip(vector[vector_index].indices, vector[vector_index].data))
    
    # Transform that zipped dict into a series
    zipped_series = ____({vocab[i]:zipped[i] for i in vector[vector_index].indices})
    
    # Sort the series to pull out the top n weighted words
    zipped_index = zipped_series.____(ascending=False)[:____].index
    return [original_vocab[i] for i in zipped_index]

# Print out the weighted words
print(return_weights(vocab, ____, text_tfidf, ____, ____))
कोड संपादित करें और चलाएँ