Matrice de similarité cosinus d'un corpus
Dans cet exercice, on vous fournit un corpus, soit une liste contenant cinq phrases. Le corpus est affiché dans la console. Vous devez calculer la matrice de similarité cosinus, qui contient le score de similarité cosinus par paire pour chaque paire de phrases (vectorisées avec tf-idf).
Rappelez-vous que la valeur à la iᵉ ligne et la jᵉ colonne d'une matrice de similarité représente le score de similarité pour les iᵉ et jᵉ vecteurs.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le NLP en Python
Instructions de l’exercice
- Initialisez une instance de
TfidfVectorizer. Nommez-latfidf_vectorizer. - À l'aide de
fit_transform(), générez les vecteurs tf-idf pourcorpus. Nommez le résultattfidf_matrix. - Utilisez
cosine_similarity()et passeztfidf_matrixpour calculer la matrice de similarité cosinuscosine_sim.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____
# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)
# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)