Similarité de segments avec spaCy
Déterminer la similarité sémantique peut vous aider à classer des textes dans des catégories prédéfinies, à détecter des textes pertinents ou à repérer du contenu en double. Dans cet exercice, vous allez pratiquer le calcul des similarités sémantiques entre des segments (spans) d'un document et un document donné. L'objectif est de trouver le Span de trois jetons le plus pertinent par rapport à canned dog food.
La catégorie canned dog food est fournie dans category. Une chaîne de texte est déjà enregistrée dans l'objet text et le modèle en_core_web_md est chargé dans nlp. Le conteneur Doc du text est aussi déjà créé et stocké dans document.
Cette activité fait partie du cours
Traitement du langage naturel avec spaCy
Instructions de l’exercice
- Créez un conteneur
Docpourcategoryet stockez-le danscategory_document. - Affichez le score de similarité d'un
Spandonné et decategory_document, arrondi à trois décimales.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)
# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))