CommencezCommencez gratuitement

Matrice de similarité cosinus d'un corpus

Dans cet exercice, on vous fournit un corpus, soit une liste contenant cinq phrases. Le corpus est affiché dans la console. Vous devez calculer la matrice de similarité cosinus, qui contient le score de similarité cosinus par paire pour chaque paire de phrases (vectorisées avec tf-idf).

Rappelez-vous que la valeur à la iᵉ ligne et la jᵉ colonne d'une matrice de similarité représente le score de similarité pour les iᵉ et jᵉ vecteurs.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le NLP en Python

Voir le cours

Instructions de l’exercice

  • Initialisez une instance de TfidfVectorizer. Nommez-la tfidf_vectorizer.
  • À l'aide de fit_transform(), générez les vecteurs tf-idf pour corpus. Nommez le résultat tfidf_matrix.
  • Utilisez cosine_similarity() et passez tfidf_matrix pour calculer la matrice de similarité cosinus cosine_sim.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____

# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)

# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)
Modifier et exécuter le code