एक corpus का cosine similarity मैट्रिक्स
इस अभ्यास में आपको corpus दिया गया है, जो पाँच वाक्यों की एक लिस्ट है. corpus कंसोल में प्रिंट हुआ है. आपको cosine similarity मैट्रिक्स निकालना है, जिसमें हर जोड़ी वाक्यों (tf-idf से वेक्टराइज़ किए गए) के लिए pairwise cosine similarity स्कोर होता है.
याद रखें, similarity मैट्रिक्स की iवीं row और jवें column का मान iवें और jवें वेक्टर का similarity स्कोर दर्शाता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में NLP के लिए Feature Engineering
अभ्यास निर्देश
TfidfVectorizerका एक इंस्टैंस इनिशियलाइज़ करें. इसेtfidf_vectorizerनाम दें.fit_transform()का उपयोग करकेcorpusके लिए tf-idf वेक्टर जनरेट करें. इसेtfidf_matrixनाम दें.cosine_similarity()का उपयोग करें औरtfidf_matrixपास करके cosine similarity मैट्रिक्सcosine_simcompute करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____
# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)
# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)