Données d’entraînement compatibles

Rappelez-vous que vous ne pouvez pas fournir le texte brut directement à spaCy. Vous devez créer un objet Example pour chaque exemple d’entraînement. Dans cet exercice, vous allez vous entraîner à convertir un training_data avec une seule phrase annotée en une liste d’objets Example.

Le modèle en_core_web_sm est déjà importé et prêt à l’emploi sous le nom nlp. La classe Example est également importée pour votre usage.

Cet exercice fait partie du cours

Traitement du langage naturel avec spaCy

Afficher le cours

Instructions

Parcourez le texte et les annotations dans training_data, convertissez le texte en conteneur Doc et stockez-le dans doc.
Créez un objet Example en utilisant l’objet doc et les annotations de chaque point de données d’entraînement, et stockez-le dans example_sentence.
Ajoutez example_sentence à une liste all_examples.

Exercice interactif pratique

Essayez cet exercice en complétant cet exemple de code.

example_text = 'A patient with chest pain had hyperthyroidism.'
training_data = [(example_text, {'entities': [(15, 25, 'SYMPTOM'), (30, 45, 'DISEASE')]})]

all_examples = []
# Iterate through text and annotations and convert text to a Doc container
for text, annotations in training_data:
  doc = nlp(____)
  
  # Create an Example object from the doc contianer and annotations
  example_sentence = ____.____(doc, ____)
  print(example_sentence.to_dict(), "\n")
  
  # Append the Example object to the list of all examples
  all_examples.append(____)
  
print("Number of formatted training data: ", len(____))

Modifier et exécuter le code

Cet exercice fait partie du cours

Traitement du langage naturel avec spaCy

IntermédiaireNiveau de compétence

4.8+

Commencer le cours gratuitement

Ce chapitre vous présentera le NLP, quelques-uns de ses cas d’usage comme la reconnaissance d’entités nommées et les chatbots dopés à l’IA. Vous apprendrez à utiliser la puissante bibliothèque spaCy pour réaliser diverses tâches de traitement du langage naturel comme la tokenisation, la segmentation en phrases, l’étiquetage morpho-syntaxique (POS) et la reconnaissance d’entités nommées.

Exercise 1: Bases du Natural Language Processing (NLP)Exercise 2: Conteneur Doc dans spaCy Exercise 3: Cas d’usage du NER Exercise 4: Tokenisation avec spaCy Exercise 5: Notions de base de spaCy Exercise 6: Exécuter un pipeline spaCy Exercise 7: Lemmatisation avec spaCy Exercise 8: Segmentation en phrases avec spaCy Exercise 9: Caractéristiques linguistiques dans spaCy Exercise 10: Étiquetage POS avec spaCy Exercise 11: Reconnaissance d’entités nommées (NER) avec spaCy Exercise 12: Traitement de texte avec spaCy

Découvrez les caractéristiques linguistiques, les vecteurs de mots, la similarité sémantique, les analogies et les opérations sur les vecteurs. Dans ce chapitre, vous verrez comment utiliser spaCy pour extraire des vecteurs de mots, catégoriser des textes liés à un sujet donné et trouver des termes sémantiquement proches de mots fournis, à partir d’un corpus ou du vocabulaire d’un modèle spaCy.

Exercise 1: Caractéristiques linguistiques Exercise 2: Annotations linguistiques dans spaCy Exercise 3: Désambiguïsation du sens des mots avec spaCy Exercise 4: Analyse en dépendances avec spaCy Exercise 5: Introduction aux vecteurs de mots Exercise 6: Vocabulaire spaCy Exercise 7: Vecteurs de mots dans le vocabulaire de spaCy Exercise 8: Vecteurs de mots et spaCy Exercise 9: Analogies et opérations sur les vecteurs Exercise 10: Projection de vecteurs de mots Exercise 11: Mots similaires dans un vocabulaire Exercise 12: Mesurer la similarité sémantique avec spaCy Exercise 13: Similarité de Doc avec spaCy Exercise 14: Similarité de spans avec spaCy Exercise 15: Similarité sémantique pour catégoriser du texte

Familiarisez-vous avec les composants de pipeline de spaCy, comment ajouter un composant de pipeline et analyser le pipeline NLP. Vous apprendrez également plusieurs approches d’extraction d’information à base de règles en utilisant les classes EntityRuler, Matcher et PhraseMatcher de spaCy ainsi que le module RegEx de Python.

Exercise 1: Pipelines spaCy Exercise 2: Ajouter des composants (pipes) dans spaCy Exercise 3: Analyser des pipelines dans spaCy Exercise 4: EntityRuler de spaCy Exercise 5: EntityRuler avec un modèle spaCy vierge Exercise 6: EntityRuler pour la NER Exercise 7: EntityRuler avec plusieurs motifs dans spaCy Exercise 8: RegEx avec spaCy Exercise 9: RegEx en Python Exercise 10: RegEx avec EntityRuler dans spaCy Exercise 11: Matcher et PhraseMatcher de spaCy Exercise 12: Faire correspondre un terme unique dans spaCy Exercise 13: PhraseMatcher dans spaCy Exercise 14: Appariement avec la syntaxe étendue dans spaCy

Explorez plusieurs cas d’usage réels où les modèles spaCy peuvent échouer et apprenez à les réentraîner pour améliorer leurs performances. Vous serez initié aux étapes d’entraînement de spaCy et comprendrez comment entraîner un modèle spaCy existant ou depuis zéro, puis évaluer le modèle au moment de l’inférence.

Exercise 1: Personnaliser les modèles spaCy Exercise 2: Entraîner des modèles spaCy Exercise 3: Performance du modèle sur vos données Exercise 4: Format des données d’entraînement spaCy Exercise 5: Étapes d’entraînement Exercise 6: Annotation et préparation des données d’entraînement Exercise 7: Données d’entraînement compatibles

Exercice en cours

Exercise 8: Entraîner avec spaCy Exercise 9: Étapes de préparation à l’entraînement Exercise 10: Entraîner un modèle NER existant Exercise 11: Entraîner un modèle spaCy à partir de zéro Exercise 12: Récapitulatif