PhraseMatcher dans spaCy

Lors du traitement de texte non structuré, vous avez souvent de longues listes et des dictionnaires que vous souhaitez parcourir et faire correspondre dans des textes donnés. Les patrons du Matcher sont définis à la main et chaque token doit être codé individuellement. Si vous avez une longue liste d’expressions, Matcher n’est plus la meilleure option. Dans ce cas, la classe PhraseMatcher permet de faire correspondre de longs dictionnaires. Dans cet exercice, vous allez vous entraîner à récupérer des patrons correspondant à la forme de plusieurs termes en utilisant la classe PhraseMatcher.

Le modèle en_core_web_sm est déjà chargé et accessible via nlp. La classe PhraseMatcher est importée. Une chaîne text et une liste terms sont à votre disposition.

Cet exercice fait partie du cours

Traitement du langage naturel avec spaCy

Afficher le cours

Instructions

Initialisez une classe PhraseMatcher avec un attr pour faire correspondre la forme des terms fournis.
Créez des patterns à ajouter à l’objet PhraseMatcher.
Trouvez les correspondances pour les patrons donnés et affichez les indices de tokens de début et de fin ainsi que la portion correspondante du text fourni.

Exercice interactif pratique

Essayez cet exercice en complétant cet exemple de code.

text = "There are only a few acceptable IP addresse: (1) 127.100.0.1, (2) 123.4.1.0."
terms = ["110.0.0.0", "101.243.0.0"]

# Initialize a PhraseMatcher class to match to shapes of given terms
matcher = ____(nlp.____, attr = ____)

# Create patterns to add to the PhraseMatcher object
patterns = [nlp.make_doc(____) for term in terms]
matcher.____("IPAddresses", patterns)

# Find matches to the given patterns and print start and end characters and matches texts
doc = ____
matches = ____
for match_id, start, end in matches:
    print("Start token: ", ____, " | End token: ", ____, "| Matched text: ", doc[____:____].text)

Modifier et exécuter le code

Cet exercice fait partie du cours

Traitement du langage naturel avec spaCy

IntermédiaireNiveau de compétence

4.8+

Commencer le cours gratuitement

Ce chapitre vous présentera le NLP, quelques-uns de ses cas d’usage comme la reconnaissance d’entités nommées et les chatbots dopés à l’IA. Vous apprendrez à utiliser la puissante bibliothèque spaCy pour réaliser diverses tâches de traitement du langage naturel comme la tokenisation, la segmentation en phrases, l’étiquetage morpho-syntaxique (POS) et la reconnaissance d’entités nommées.

Exercise 1: Bases du Natural Language Processing (NLP)Exercise 2: Conteneur Doc dans spaCy Exercise 3: Cas d’usage du NER Exercise 4: Tokenisation avec spaCy Exercise 5: Notions de base de spaCy Exercise 6: Exécuter un pipeline spaCy Exercise 7: Lemmatisation avec spaCy Exercise 8: Segmentation en phrases avec spaCy Exercise 9: Caractéristiques linguistiques dans spaCy Exercise 10: Étiquetage POS avec spaCy Exercise 11: Reconnaissance d’entités nommées (NER) avec spaCy Exercise 12: Traitement de texte avec spaCy

Découvrez les caractéristiques linguistiques, les vecteurs de mots, la similarité sémantique, les analogies et les opérations sur les vecteurs. Dans ce chapitre, vous verrez comment utiliser spaCy pour extraire des vecteurs de mots, catégoriser des textes liés à un sujet donné et trouver des termes sémantiquement proches de mots fournis, à partir d’un corpus ou du vocabulaire d’un modèle spaCy.

Exercise 1: Caractéristiques linguistiques Exercise 2: Annotations linguistiques dans spaCy Exercise 3: Désambiguïsation du sens des mots avec spaCy Exercise 4: Analyse en dépendances avec spaCy Exercise 5: Introduction aux vecteurs de mots Exercise 6: Vocabulaire spaCy Exercise 7: Vecteurs de mots dans le vocabulaire de spaCy Exercise 8: Vecteurs de mots et spaCy Exercise 9: Analogies et opérations sur les vecteurs Exercise 10: Projection de vecteurs de mots Exercise 11: Mots similaires dans un vocabulaire Exercise 12: Mesurer la similarité sémantique avec spaCy Exercise 13: Similarité de Doc avec spaCy Exercise 14: Similarité de spans avec spaCy Exercise 15: Similarité sémantique pour catégoriser du texte

Familiarisez-vous avec les composants de pipeline de spaCy, comment ajouter un composant de pipeline et analyser le pipeline NLP. Vous apprendrez également plusieurs approches d’extraction d’information à base de règles en utilisant les classes EntityRuler, Matcher et PhraseMatcher de spaCy ainsi que le module RegEx de Python.

Exercise 1: Pipelines spaCy Exercise 2: Ajouter des composants (pipes) dans spaCy Exercise 3: Analyser des pipelines dans spaCy Exercise 4: EntityRuler de spaCy Exercise 5: EntityRuler avec un modèle spaCy vierge Exercise 6: EntityRuler pour la NER Exercise 7: EntityRuler avec plusieurs motifs dans spaCy Exercise 8: RegEx avec spaCy Exercise 9: RegEx en Python Exercise 10: RegEx avec EntityRuler dans spaCy Exercise 11: Matcher et PhraseMatcher de spaCy Exercise 12: Faire correspondre un terme unique dans spaCy Exercise 13: PhraseMatcher dans spaCy

Exercice en cours

Exercise 14: Appariement avec la syntaxe étendue dans spaCy

Explorez plusieurs cas d’usage réels où les modèles spaCy peuvent échouer et apprenez à les réentraîner pour améliorer leurs performances. Vous serez initié aux étapes d’entraînement de spaCy et comprendrez comment entraîner un modèle spaCy existant ou depuis zéro, puis évaluer le modèle au moment de l’inférence.

Exercise 1: Personnaliser les modèles spaCy Exercise 2: Entraîner des modèles spaCy Exercise 3: Performance du modèle sur vos données Exercise 4: Format des données d’entraînement spaCy Exercise 5: Étapes d’entraînement Exercise 6: Annotation et préparation des données d’entraînement Exercise 7: Données d’entraînement compatibles Exercise 8: Entraîner avec spaCy Exercise 9: Étapes de préparation à l’entraînement Exercise 10: Entraîner un modèle NER existant Exercise 11: Entraîner un modèle spaCy à partir de zéro Exercise 12: Récapitulatif