CommencezCommencez gratuitement

Similarité de segments avec spaCy

Déterminer la similarité sémantique peut vous aider à classer des textes dans des catégories prédéfinies, à détecter des textes pertinents ou à repérer du contenu en double. Dans cet exercice, vous allez pratiquer le calcul des similarités sémantiques entre des segments (spans) d'un document et un document donné. L'objectif est de trouver le Span de trois jetons le plus pertinent par rapport à canned dog food.

La catégorie canned dog food est fournie dans category. Une chaîne de texte est déjà enregistrée dans l'objet text et le modèle en_core_web_md est chargé dans nlp. Le conteneur Doc du text est aussi déjà créé et stocké dans document.

Cette activité fait partie du cours

Traitement du langage naturel avec spaCy

Voir le cours

Instructions de l’exercice

  • Créez un conteneur Doc pour category et stockez-le dans category_document.
  • Affichez le score de similarité d'un Span donné et de category_document, arrondi à trois décimales.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)

# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))
Modifier et exécuter le code