शुरू करेंमुफ़्त में शुरू करें

एक corpus का cosine similarity मैट्रिक्स

इस अभ्यास में आपको corpus दिया गया है, जो पाँच वाक्यों की एक लिस्ट है. corpus कंसोल में प्रिंट हुआ है. आपको cosine similarity मैट्रिक्स निकालना है, जिसमें हर जोड़ी वाक्यों (tf-idf से वेक्टराइज़ किए गए) के लिए pairwise cosine similarity स्कोर होता है.

याद रखें, similarity मैट्रिक्स की iवीं row और jवें column का मान iवें और jवें वेक्टर का similarity स्कोर दर्शाता है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में NLP के लिए Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • TfidfVectorizer का एक इंस्टैंस इनिशियलाइज़ करें. इसे tfidf_vectorizer नाम दें.
  • fit_transform() का उपयोग करके corpus के लिए tf-idf वेक्टर जनरेट करें. इसे tfidf_matrix नाम दें.
  • cosine_similarity() का उपयोग करें और tfidf_matrix पास करके cosine similarity मैट्रिक्स cosine_sim compute करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____

# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)

# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)
कोड संपादित करें और चलाएँ